推論(reasoning)
レッドチームのモデルは答える前に推論します。推論に使った tokens は completion_tokens に含まれ、max_tokens の内側で数えられます。max_tokens が小さいと推論だけで使い切り、content が空のまま finish_reason: length になります。
// too small: 32 tokens of reasoning, no answer
{"max_tokens": 32} → "finish_reason": "length", "content": null
// give the answer room (the free tier allows up to 32768)
{"max_tokens": 2048}
パラメータ
- reasoning_effort / reasoning のうち効くのは thinking を消す要求だけです: reasoning_effort "none" または reasoning {enabled:false} は origin に enable_thinking=false として転送されます。深さのレベルは none | minimal | low | medium | high を受理します(この構成の thinking は 1024 tokens で頭打ち)、それより深い xhigh / max / ultra は 400 で返します — 上限つきで黙って従うより正直です。
- 応答には推論本文は含まれません。usage.completion_tokens で量だけ分かります。
- 有料の場合、推論 tokens も出力単価で精算されます(レシートの completion_tokens)。