Skip to main content
Qwen3.8-Max (qwen3.8-max) — новый флагман Alibaba Qwen, выпущенный 3 августа 2026 года. Это sparse MoE model с 2,4 трлн общих параметров, контекстным окном 1M, максимальным output 131K и нативной поддержкой ввода текста, изображений и видео. APIYI добавил его в день релиза и выполнил по нему 586 живых тестовых вызовов — матрица возможностей, поведение параметров и заметки по тарификации на этой странице основаны именно на этих тестах, а не на пересказе официальной документации.
Qwen3.8-Max доступен на APIYI: имя модели qwen3.8-max. Thinking включен по умолчанию (на уровне xhigh, а thinking tokens тарифицируются как output), поэтому для повседневного чата явно задавайте reasoning_effort="none" — в тестах это снизило output примерно со 158 tokens до 5. Для предыдущего поколения см. Серия Qwen3.6 (legacy).

Почему эта модель

17.5% ниже официальной

$1.65 за input, $4.95 за output на 1M tokens против $2/$6 у Alibaba Cloud. Акции на пополнение суммируются дополнительно.

Контекст 1M, подтверждено

На корпусах 8K / 32K / 128K с маркерами, размещенными в середине документа и в конце, оба эндпоинта точно воспроизвели все 6/6. Вызов на 128K занимает около 80 секунд.

Три модальности, одна модель

Работа с input текстом, изображениями и видео — все подтверждено как работающее; не нужно переключаться между «long-context model» и «vision model».

Значительно более сильная агентная работа

FrontierSWE вырос с 40.7 у предыдущего поколения до 73.5, DeepSWE — с 21.6 до 56.6. Цепочка вызова tools завершена, подтверждены round-trip в два раунда.

Поддержка эндпоинтов

Тарификация

За 1 млн tokens, прейскурантная цена до скидок: Акции на пополнение суммируются и позволяют снизить фактическую стоимость.

Specifications

Официальные бенчмарки: GPQA Diamond 92.6, PaperBench 93.0, OmniDocBench 1.5 92.1, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, IFBench 82.8, FrontierSWE 73.5, SWE-bench Pro 67.7.

Управление рассуждением (самый важный раздел)

Qwen3.8-Max по умолчанию выполняет рассуждение на уровне xhigh. Токены рассуждения тарифицируются как output и часто составляют более 90% от него.

Семь значений, четыре реальных уровня

Параметр принимает 7 значений, но на практике соответствует только 4 реальным уровням: Передача max не заставляет рассуждать сильнее, чем xhigh. Любое другое значение возвращает 400 с перечнем допустимых значений.

Как выключить рассуждение

enable_thinking: false в extra_body и chat_template_kwargs: {"enable_thinking": false} эквивалентны и тоже работают.
max_tokens не ограничивает токены рассуждения. Мы задали max_tokens=1 и все равно были тарифицированы за 1,054 output tokens, из них 1,045 — за рассуждение.max_tokens только обрезает видимый ответ. Используйте reasoning_effort, чтобы управлять стоимостью — не полагайтесь на max_tokens.

thinking_budget не влияет

Передача 128 / 512 / 4096 ведет себя точно так же, как уровень low; само число игнорируется. Используйте reasoning_effort вместо этого.

Примеры кода

Python (совместимо с OpenAI SDK)

Ввод изображения

Удаленные URL-адреса изображений также работают на этом эндпоинте — просто задайте url как адрес https://....

Ввод видео

В тестировании понимание видео занимало 144–285 секунд на каждый вызов. Установите тайм-аут клиента выше 300 секунд и предпочитайте потоковую передачу или асинхронную очередь задач.
Также есть форма с последовательностью кадров, {"type": "video", "video": [frame1, frame2, ...]}, которая требует 4–8000 кадров — если кадров меньше 4, возвращается 400.

cURL

Вызов инструментов

Вызов инструментов на эндпоинте Chat Completions полностью работает: один инструмент, параллельные инструменты, двухраундовый round-trip, выбор 1 из 20 инструментов, дельты при потоковой передаче и parallel_tool_calls: false — все подтверждено.
Принудительные вызовы инструментов требуют отключенного thinking. Когда tool_choice имеет значение "required" или указывает на конкретную функцию, вам также нужно задать reasoning_effort="none" — иначе вы получите 400 (tool_choice does not support being set to required or object in thinking mode) или вызов будет пропущен без ошибки.tool_choice, установленный на "auto" / "none", не затрагивается. То же относится к n > 1.

Структурированный вывод

response_format с json_schema, строго соблюдаемым в тестировании: вложенные объекты, enums, arrays и additionalProperties: false все сработали, без дополнительных полей и без Markdown-fences.
Отключите рассуждение для структурированного вывода. Та же схема, измерено бок о бок:Соответствие было идентичным; стоимость и задержка отличаются на порядок.

Кэширование контекста

  • Порог попадания около 1,024 tokens: префикс из 818 tokens не попал в кэш; 1,070 tokens и выше попадали
  • Реальные многотуровые беседы действительно дают попадания: при добавлении сообщений по раундам попадание было в каждом раунде
  • Длинные документы выигрывают больше всего: 98.6% закэшированного ввода при 128K, 99.3% при 32K
Попадания в кэш были нестабильны при тестировании — один и тот же префикс в одних раундах попадал в кэш, а в других нет, и TTL нельзя надежно вывести из ответа API. Рассматривайте кэширование как бонус, когда оно срабатывает; не стройте на нем прогнозы затрат.

Использование эндпоинта Anthropic

/v1/messages подходит для интеграции с кодом, но вы должны удалить блоки thinking перед повторным воспроизведением истории, иначе получите 400 (if content is list. item must be dict and key[type] should in dict).
С этим фильтром мы проверили память между ходами на 3 сообщения, двухраундовый обмен с tool и сохранение результатов tool в последующих ходах.
Готовые клиенты, такие как Claude Code, пока не подходят для использования — по умолчанию они дословно воспроизводят контент-блоки из истории, и их поведение нельзя изменить, поэтому на втором ходе возвращается 400. Используйте /v1/chat/completions вместо этого.
Другие отличия этого эндпоинта: response_format игнорируется без предупреждения (для структурированного вывода принудительно вызывайте tool), tool_choice принимает только формат OpenAI, изображения должны быть в base64 (внешние URL возвращают 400), а reasoning_effort не имеет эффекта (используйте thinking: {"type": "disabled"}, чтобы отключить thinking).

Совместимость параметров

Лучшие практики

Повседневный чат и высоконагруженные вызовы

Явно задайте reasoning_effort="none". Измеренная задержка снизилась примерно с ~5 с до 2 с, а число выходных tokens — примерно до 1/30.

Длинные документы и кодовые базы

В тестировании 128K recall был точным, а показатели попадания в кэш для длинных документов высоки. Поместите большой документ в начало списка сообщений, а вопрос — в конец.

Извлечение данных

Ограничьте с помощью json_schema и отключите thinking. Соответствие не ухудшается.

Агенты и оркестрация инструментов

Используйте /v1/chat/completions. Не забудьте отключить thinking при принудительном вызове инструмента.

Частые вопросы

max_tokens ограничивает только видимый ответ, а не часть рассуждения. Мы измерили 1,054 выходных tokens, начисленных по max_tokens=1. Используйте reasoning_effort="none", чтобы контролировать затраты.
Принудительный выбор инструмента не поддерживается, когда включено рассуждение. Передайте reasoning_effort="none" вместе с ним.
Этот эндпоинт пока не подключен к модели — все 30 тестовых вызовов завершились неудачей, а код ошибки чередовался между 404 и 400. Это было передано upstream, и мы объявим об этом в Оперативные обновления, как только он станет доступен. Используйте /v1/chat/completions вместо него.
Пока нет. Эндпоинт /v1/messages отклоняет сообщения истории, содержащие блоки thinking, а Claude Code воспроизводит их дословно. При вызове из своего кода удалите эти блоки, и эндпоинт будет работать нормально.
Модель обслуживается более чем по одному upstream-маршруту, и один из них не сообщает reasoning_tokens или cached_tokens — это наблюдается примерно в трети chat-запросов. Это было передано upstream для согласования. Имейте это в виду, если вам нужен точный учет затрат на рассуждение.
Анализ video занимал 144–285 секунд на вызов; это собственное время обработки модели. Установите timeout выше 300 секунд и рассмотрите асинхронную очередь.

Связанные материалы

Измерения на этой странице получены на основе 586 live-запросов, выполненных 2026-08-03 (12:50–14:35 UTC+8). Выводы, связанные с тарификацией, основаны на полях usage, возвращаемых API, и не были построчно сверены со счетами. Поведение модели и шлюза может меняться по мере настройки каналов — считайте live-запросы источником истины.