Skip to main content
POST
Chat completion: Qwen3.8-Max (OpenAI compatible)
Используйте playground справа, чтобы отправлять запросы напрямую: укажите Bearer sk-your-api-key в Authorization. В примере уже указан reasoning_effort: "none" — нажмите send, чтобы увидеть ответ.
По умолчанию модель использует рассуждение (tier xhigh, тарифицируется как output). В примере рассуждение отключено, чтобы отладка была быстрой и дешевой; для сложного рассуждения удалите поле reasoning_effort и увеличьте max_tokens до 4000+. Полное описание см. в обзоре Qwen3.8-Max.

Краткая справка по параметрам

Три распространенные ошибки

1. max_tokens не ограничивает рассуждение. Мы установили max_tokens=1 и все равно заплатили за 1,054 output tokens (1,045 из них — на рассуждение). Используйте reasoning_effort="none", чтобы контролировать стоимость.2. Принудительные вызовы tools требуют отключить рассуждение. Если tool_choice установлен в "required" или именованную функцию, режим рассуждения возвращает 400 или молча пропускает вызов — передавайте reasoning_effort="none" вместе с ним.3. thinking_budget не влияет. Любое значение работает как тарифный уровень low; вместо этого используйте reasoning_effort.

Чтение ответа

  • Трасса рассуждения находится в choices[0].message.reasoning_content (возвращается, пока включено рассуждение)
  • Стоимость рассуждения находится в usage.completion_tokens_details.reasoning_tokens; попадания в кэш — в usage.prompt_tokens_details.cached_tokens
  • Некоторые upstream-маршруты не сообщают эти два поля (примерно у одной трети запросов в тестировании) — учитывайте это, если вам нужен точный учет стоимости рассуждения
  • Семь допустимых значений reasoning_effort отображаются только в четыре реальных уровня; max не рассуждает глубже, чем xhigh
  • Недопустимое значение reasoning_effort возвращает 400 со списком всех допустимых значений, а не выполняет тихое понижение уровня

Связанное

Авторизации

Authorization
string
header
обязательно

Add Authorization: Bearer YOUR_API_KEY to the request header

Тело

application/json
model
string
обязательно

Always qwen3.8-max

messages
object[]
обязательно

Standard OpenAI message array

max_tokens
integer

Output budget for the visible answer, range [1, 131072]. Note: does not bound thinking tokens

reasoning_effort
enum<string>

Thinking tier, default xhigh. Measured to have only four real tiers: none / minimal≡low / medium / high≡xhigh≡max

Доступные опции:
none,
minimal,
low,
medium,
high,
xhigh,
max
temperature
number

Valid range [0.0, 2.0); passing 2 returns 400

top_p
number

Valid range (0.0, 1.0]

top_k
integer
stream
boolean

SSE streaming. This endpoint returns usage in the final chunk even without stream_options

stop
string[]

Stop sequences, verified working

response_format
object

Structured output; json_schema held strictly in testing. Pair it with reasoning_effort: none

tools
object[]

Function calling tool list, verified working

tool_choice
any

auto / none work as-is; required or a named function requires reasoning_effort: none

parallel_tool_calls
boolean

Set false to limit to a single tool call, verified working

n
integer

Number of candidates. Values above 1 require reasoning_effort: none

logprobs
boolean

Ответ

Chat completion succeeded

id
string
model
string
choices
object[]
usage
object

Usage stats. Some upstream routes do not report reasoning_tokens or cached_tokens