qwen3.8-max) — новый флагман Alibaba Qwen, выпущенный 3 августа 2026 года. Это sparse MoE model с 2,4 трлн общих параметров, контекстным окном 1M, максимальным output 131K и нативной поддержкой ввода текста, изображений и видео. APIYI добавил его в день релиза и выполнил по нему 586 живых тестовых вызовов — матрица возможностей, поведение параметров и заметки по тарификации на этой странице основаны именно на этих тестах, а не на пересказе официальной документации.
qwen3.8-max. Thinking включен по умолчанию (на уровне xhigh, а thinking tokens тарифицируются как output), поэтому для повседневного чата явно задавайте reasoning_effort="none" — в тестах это снизило output примерно со 158 tokens до 5. Для предыдущего поколения см. Серия Qwen3.6 (legacy).Почему эта модель
17.5% ниже официальной
Контекст 1M, подтверждено
Три модальности, одна модель
Значительно более сильная агентная работа
Поддержка эндпоинтов
Тарификация
За 1 млн tokens, прейскурантная цена до скидок:Specifications
Управление рассуждением (самый важный раздел)
Qwen3.8-Max по умолчанию выполняет рассуждение на уровнеxhigh. Токены рассуждения тарифицируются как output и часто составляют более 90% от него.
Семь значений, четыре реальных уровня
Параметр принимает 7 значений, но на практике соответствует только 4 реальным уровням:max не заставляет рассуждать сильнее, чем xhigh. Любое другое значение возвращает 400 с перечнем допустимых значений.
Как выключить рассуждение
enable_thinking: false в extra_body и chat_template_kwargs: {"enable_thinking": false} эквивалентны и тоже работают.
thinking_budget не влияет
Передача 128 / 512 / 4096 ведет себя точно так же, как уровень low; само число игнорируется. Используйте reasoning_effort вместо этого.
Примеры кода
Python (совместимо с OpenAI SDK)
Ввод изображения
url как адрес https://....
Ввод видео
{"type": "video", "video": [frame1, frame2, ...]}, которая требует 4–8000 кадров — если кадров меньше 4, возвращается 400.
cURL
Вызов инструментов
Вызов инструментов на эндпоинте Chat Completions полностью работает: один инструмент, параллельные инструменты, двухраундовый round-trip, выбор 1 из 20 инструментов, дельты при потоковой передаче иparallel_tool_calls: false — все подтверждено.
Структурированный вывод
response_format с json_schema, строго соблюдаемым в тестировании: вложенные объекты, enums, arrays и additionalProperties: false все сработали, без дополнительных полей и без Markdown-fences.
Кэширование контекста
- Порог попадания около 1,024 tokens: префикс из 818 tokens не попал в кэш; 1,070 tokens и выше попадали
- Реальные многотуровые беседы действительно дают попадания: при добавлении сообщений по раундам попадание было в каждом раунде
- Длинные документы выигрывают больше всего: 98.6% закэшированного ввода при 128K, 99.3% при 32K
Использование эндпоинта Anthropic
/v1/messages подходит для интеграции с кодом, но вы должны удалить блоки thinking перед повторным воспроизведением истории, иначе получите 400 (if content is list. item must be dict and key[type] should in dict).
response_format игнорируется без предупреждения (для структурированного вывода принудительно вызывайте tool), tool_choice принимает только формат OpenAI, изображения должны быть в base64 (внешние URL возвращают 400), а reasoning_effort не имеет эффекта (используйте thinking: {"type": "disabled"}, чтобы отключить thinking).
Совместимость параметров
Лучшие практики
Повседневный чат и высоконагруженные вызовы
reasoning_effort="none". Измеренная задержка снизилась примерно с ~5 с до 2 с, а число выходных tokens — примерно до 1/30.Длинные документы и кодовые базы
Извлечение данных
json_schema и отключите thinking. Соответствие не ухудшается.Агенты и оркестрация инструментов
/v1/chat/completions. Не забудьте отключить thinking при принудительном вызове инструмента.Частые вопросы
Почему после установки max_tokens с меня по-прежнему списывается много tokens?
Почему после установки max_tokens с меня по-прежнему списывается много tokens?
max_tokens ограничивает только видимый ответ, а не часть рассуждения. Мы измерили 1,054 выходных tokens, начисленных по max_tokens=1. Используйте reasoning_effort="none", чтобы контролировать затраты.Почему tool_choice с именованной функцией возвращает 400?
Почему tool_choice с именованной функцией возвращает 400?
reasoning_effort="none" вместе с ним.Почему я не могу обратиться к /v1/responses?
Почему я не могу обратиться к /v1/responses?
/v1/chat/completions вместо него.Могу ли я использовать эту модель в Claude Code?
Могу ли я использовать эту модель в Claude Code?
/v1/messages отклоняет сообщения истории, содержащие блоки thinking, а Claude Code воспроизводит их дословно. При вызове из своего кода удалите эти блоки, и эндпоинт будет работать нормально.Почему reasoning_tokens иногда отсутствует в usage?
Почему reasoning_tokens иногда отсутствует в usage?
reasoning_tokens или cached_tokens — это наблюдается примерно в трети chat-запросов. Это было передано upstream для согласования. Имейте это в виду, если вам нужен точный учет затрат на рассуждение.Почему видеовызовы такие медленные?
Почему видеовызовы такие медленные?
Связанные материалы
- Песочница Qwen3.8-Max — отправляйте запросы напрямую
- Серия Qwen3.6 (устаревшая) — предыдущие пять моделей
- Заметки о запуске Qwen3.8-Max — бенчмарки и полный разбор
- Тарификация моделей — тарифы по каждой модели, тарификация кэша и доступные эндпоинты
- Акции на пополнение — суммируемые скидки