qwen3.8-max) — новый флагман Alibaba Qwen, выпущенный 3 августа 2026 года. Это sparse MoE model с 2,4 трлн общих параметров, контекстным окном 1M, максимальным output 131K и нативной поддержкой ввода текста, изображений и видео. APIYI добавил его в день релиза и выполнил по нему 586 живых тестовых вызовов — матрица возможностей, поведение параметров и заметки по тарификации на этой странице основаны именно на этих тестах, а не на пересказе официальной документации.
qwen3.8-max. Thinking включен по умолчанию (на уровне xhigh, а thinking tokens тарифицируются как output), поэтому для повседневного чата явно задавайте reasoning_effort="none" — в тестах это снизило output примерно со 158 tokens до 5. Для предыдущего поколения см. Серия Qwen3.6 (legacy).Почему эта модель
17.5% ниже официальной
Контекст 1M, подтверждено
Три модальности, одна модель
Значительно более сильная агентная работа
Поддержка эндпоинтов
Тарификация
За 1 млн tokens, прейскурантная цена до скидок:Specifications
Управление рассуждением (самый важный раздел)
Qwen3.8-Max по умолчанию выполняет рассуждение на уровнеxhigh. Токены рассуждения тарифицируются как output и часто составляют более 90% от него.
Семь значений, четыре реальных уровня
Параметр принимает 7 значений, но на практике соответствует только 4 реальным уровням:max не заставляет рассуждать сильнее, чем xhigh. Любое другое значение возвращает 400 с перечнем допустимых значений.
Как выключить рассуждение
enable_thinking: false в extra_body и chat_template_kwargs: {"enable_thinking": false} эквивалентны и тоже работают.
thinking_budget не влияет
Передача 128 / 512 / 4096 ведет себя точно так же, как уровень low; само число игнорируется. Используйте reasoning_effort вместо этого.
Примеры кода
Python (совместимо с OpenAI SDK)
Ввод изображения
url как адрес https://....
Ввод видео
{"type": "video", "video": [frame1, frame2, ...]}, которая требует 4–8000 кадров — если кадров меньше 4, возвращается 400.
cURL
Вызов инструментов
Вызов инструментов на эндпоинте Chat Completions полностью работает: один инструмент, параллельные инструменты, двухраундовый round-trip, выбор 1 из 20 инструментов, дельты при потоковой передаче иparallel_tool_calls: false — все подтверждено.
Структурированный вывод
response_format с json_schema, строго соблюдаемым в тестировании: вложенные объекты, enums, arrays и additionalProperties: false все сработали, без дополнительных полей и без Markdown-fences.
Кэширование контекста
- Порог попадания в кэш около 1,024 tokens: префикс из 818 token не сработал; 1,070 tokens и выше — срабатывали
- Реальные многоходовые диалоги действительно попадают в кэш: при добавлении сообщений ход за ходом попадание срабатывало в каждом раунде
- Длинные документы выигрывают сильнее всего: 98.6% входных данных в кэше при 128K, 99.3% при 32K
Использование Anthropic endpoint
/v1/messages подходит для интеграции кода, но перед повторным воспроизведением истории вы обязательно должны удалить блоки thinking, иначе получите 400 (if content is list. item must be dict and key[type] should in dict).
Дополнение от 2026-08-08: сам многоходовый вызов инструмента работает нормально
Специальное повторное тестирование на 300 вызовов подтверждает, что сама цепочка многоходовогоtool_use / tool_result работает. Единственное препятствие — блок thinking:
tool_resultне имеет дополнительных ограничений на формат. String- или block-arraycontent,is_errortrue или false, пустые результаты, результаты размером 50KB, воспроизведение не по порядку, частичное воспроизведение, поддельныеtool_use_id— все 15 вариантов прошли. Управляющие символы, emoji и одна строка длиной 200,000 символов тоже прошли.- Никакое значение
signatureне поможет. Пустая строка,null, полное удаление ключа или поддельное значение — всё возвращает тот же 400. Вам нужно удалить весь блок. - Нагрузочный тест проходит после удаления этого блока. Автономный цикл агента с system prompt на 24K token и 8 инструментами, 12 ходов × 2 прогона, при росте контекста до 28.7K — 24/24 успешно.
- SSE-события полные:
message_start,content_block_start,content_block_delta,content_block_stop,message_delta,message_stop, а такжеping.text_delta,thinking_delta,signature_deltaиinput_json_deltaвсе работают корректно. - Не наблюдалось ни лимита запросов, ни ограничения на параллельные запросы: один и тот же запрос, повторённый 40 раз последовательно, все разы успешно завершался, а уровни параллельных запросов 1 / 4 / 8 / 16 / 32 также все завершились успешно без 429.
Что делать, если вы хотите использовать это внутри Claude Code
Для этого класса проблем вида «не работает в одном конкретном клиенте» ограничение вполне может быть на стороне модели, а не в нашей адаптации. Мы рекомендуем сначала проверить тот же сценарий на собственной платформе Alibaba Cloud Bailian (консоль:bailian.console.aliyun.com):
- если официальный платформенный вариант тоже отклоняет это, значит, это ограничение на стороне модели, и обойти его у нас нет возможности;
- если там это работает, а здесь нет, отправьте нам тело запроса, и мы передадим вопрос провайдеру канала.
Другие отличия и практические замечания
response_formatмолча игнорируется (принудительно вызовите инструмент для структурированного вывода)tool_choiceпринимает только формат OpenAI; принудительный вызов инструмента (requiredили именованная функция) не поддерживается в thinking mode на обоих endpoint- Изображения должны быть в base64; удалённые URL возвращают 400
reasoning_effortне имеет эффекта — используйтеthinking: {"type": "disabled"}, чтобы отключить thinkingstop_sequencesдействительно обрезает, ноstop_reasonошибочно сообщается какend_turn, а полеstop_sequenceвозвращаетсяnull, поэтому не полагайтесь на это, чтобы определить, почему генерация остановилась- Учет usage при потоковой передаче зависит от маршрута: на некоторых маршрутах
input_tokensвmessage_startненадёжно, а на других итоговое потоковоеoutput_tokensвсегда равно 0. Для точного учёта используйте usage без потоковой передачи или ваши записи тарификации - Измеренный верхний предел входа составляет 983,616 token; превышение возвращает
Range of input length should be [1, 983616]
Совместимость параметров
Лучшие практики
Повседневный чат и высоконагруженные вызовы
reasoning_effort="none". Измеренная задержка снизилась примерно с ~5 с до 2 с, а число выходных tokens — примерно до 1/30.Длинные документы и кодовые базы
Извлечение данных
json_schema и отключите thinking. Соответствие не ухудшается.Агенты и оркестрация инструментов
/v1/chat/completions. Не забудьте отключить thinking при принудительном вызове инструмента.Часто задаваемые вопросы
Почему после установки max_tokens мне всё равно списывают много tokens?
Почему после установки max_tokens мне всё равно списывают много tokens?
max_tokens ограничивает только видимый ответ, а не часть рассуждения. Мы измерили, что за 1 054 выходных tokens было списано max_tokens=1. Используйте reasoning_effort="none", чтобы контролировать затраты.Почему tool_choice с именованной функцией возвращает 400?
Почему tool_choice с именованной функцией возвращает 400?
reasoning_effort="none" вместе с ним.Почему я не могу обратиться к /v1/responses?
Почему я не могу обратиться к /v1/responses?
/v1/chat/completions.Могу ли я использовать эту модель в Claude Code?
Могу ли я использовать эту модель в Claude Code?
/v1/messages отклоняет сообщения истории, содержащие блоки thinking, а Claude Code воспроизводит их дословно — поэтому первый ход порождает tool_use, а второй ход возвращает 400, когда tool_result возвращается обратно. При вызове из собственного кода удалите эти блоки, и эндпоинт работает нормально.Если вам нужно работать внутри Claude Code, более простой путь — серия APIYI Claude или серия OpenAI: группа по умолчанию официально маршрутизируется и не требует дополнительной адаптации. Вы также можете сначала проверить тот же вариант использования на платформе Alibaba Cloud Bailian (bailian.console.aliyun.com); если официальная платформа тоже отклоняет его, это ограничение на стороне модели.Почему первый ход работает, а затем всё зависает или выдаёт ошибку после отправки результатов tool?
Почему первый ход работает, а затем всё зависает или выдаёт ошибку после отправки результатов tool?
/v1/messages. Повторно воспроизведённое сообщение ассистента содержит блок thinking, который эндпоинт отклоняет с 400. Установка signature в пустую строку или null, либо удаление поля, не помогает — вам нужно удалить весь блок thinking.После удаления в тестировании успешно завершился 12-ходовой цикл tool при контекстном окне 24K. Сам по себе многоходовой цикл tool_use / tool_result не является проблемой.Почему иногда в usage отсутствуют поля reasoning_tokens или cache?
Почему иногда в usage отсутствуют поля reasoning_tokens или cache?
reasoning_tokens и cached_tokens, некоторые всегда сообщают cache_read_input_tokens как 0, а некоторые всегда сообщают итоговый streamed output_tokens равным 0. Это уже передано upstream для согласования.То, что сообщает API, — это не то, что вы оплачиваете. Для точного учёта используйте детализацию тарификации по отдельному запросу в журнале консоли, где показан полный расчёт как по базовой, так и по cache-начислениям.Почему видеовызовы такие медленные?
Почему видеовызовы такие медленные?
Связанные материалы
- Песочница Qwen3.8-Max — отправляйте запросы напрямую
- Серия Qwen3.6 (устаревшая) — предыдущие пять моделей
- Заметки о запуске Qwen3.8-Max — бенчмарки и полный разбор
- Тарификация моделей — тарифы по каждой модели, тарификация кэша и доступные эндпоинты
- Акции на пополнение — суммируемые скидки