Skip to main content
POST
Chat completion: Qwen3.8-Max (OpenAI compatible)
右側のプレイグラウンドを使って、直接リクエストを送信できます。AuthorizationBearer sk-your-api-key を入れてください。例にはすでに reasoning_effort: "none" が含まれています。送信してレスポンスを確認してください。
このモデルはデフォルトで推論します(tier xhigh、課金は output として扱われます)。この例では、デバッグを高速かつ低コストに保つために推論を無効化しています。難しい推論を行う場合は、reasoning_effort フィールドを削除し、max_tokens を 4000+ に上げてください。詳しい解説は、Qwen3.8-Max の概要 をご覧ください。

パラメータ クイックリファレンス

3つのよくあるミス

1. max_tokens では推論の上限は設定されません。 max_tokens=1 を設定しましたが、それでも出力 token が 1,054 個課金されました(うち 1,045 個は推論です)。コストを抑えるには reasoning_effort="none" を使用してください。2. 強制的なツール呼び出しには推論をオフにする必要があります。 tool_choice"required" または名前付き関数に設定すると、推論モードは 400 を返すか、何も言わずに呼び出しをスキップします。これと併せて reasoning_effort="none" を指定してください。3. thinking_budget には効果がありません。 どの値でも low ティアと同じように扱われます。代わりに reasoning_effort を使用してください。

レスポンスの読み方

  • thinking トレースは choices[0].message.reasoning_content にあります(thinking がオンのときに返されます)
  • thinking コストは usage.completion_tokens_details.reasoning_tokens にあり、キャッシュヒットは usage.prompt_tokens_details.cached_tokens です
  • 一部の上流ルートはこの 2 つのフィールドを報告しません(テストではリクエストのおよそ 3 分の 1) — 正確な thinking コストの集計が必要な場合は、この点に留意してください
  • 7 つの有効な reasoning_effort 値は、実際には 4 つのティアに対応します。maxxhigh より深く推論しません
  • 不正な reasoning_effort 値を指定すると、黙ってダウングレードされるのではなく、有効な全セットを列挙した 400 が返されます

関連

承認

Authorization
string
header
必須

Add Authorization: Bearer YOUR_API_KEY to the request header

ボディ

application/json
model
string
必須

Always qwen3.8-max

messages
object[]
必須

Standard OpenAI message array

max_tokens
integer

Output budget for the visible answer, range [1, 131072]. Note: does not bound thinking tokens

reasoning_effort
enum<string>

Thinking tier, default xhigh. Measured to have only four real tiers: none / minimal≡low / medium / high≡xhigh≡max

利用可能なオプション:
none,
minimal,
low,
medium,
high,
xhigh,
max
temperature
number

Valid range [0.0, 2.0); passing 2 returns 400

top_p
number

Valid range (0.0, 1.0]

top_k
integer
stream
boolean

SSE streaming. This endpoint returns usage in the final chunk even without stream_options

stop
string[]

Stop sequences, verified working

response_format
object

Structured output; json_schema held strictly in testing. Pair it with reasoning_effort: none

tools
object[]

Function calling tool list, verified working

tool_choice
any

auto / none work as-is; required or a named function requires reasoning_effort: none

parallel_tool_calls
boolean

Set false to limit to a single tool call, verified working

n
integer

Number of candidates. Values above 1 require reasoning_effort: none

logprobs
boolean

レスポンス

Chat completion succeeded

id
string
model
string
choices
object[]
usage
object

Usage stats. Some upstream routes do not report reasoning_tokens or cached_tokens