Skip to main content
Эта страница является устаревшим архивом. Текущий флагман Alibaba Qwen — Qwen3.8-Max, выпущенный в августе 2026 года: 2.4T параметров, контекст 1M, нативный ввод изображений и видео, указан на 17.5% ниже официальной цены Alibaba. Нижеуказанные пять моделей Qwen3.6 по-прежнему доступны для вызова с неизменными ценами и интеграцией, но новые проекты следует начинать с Qwen3.8-Max.
Qwen3.6 — это семейство моделей следующего поколения Alibaba Tongyi Qianwen, выпущенное во 2 квартале 2026 года в трех закрытых production-уровнях — Max (флагман), Plus (сбалансированный), Flash (ориентирован на скорость) — а также в двух вариантах с открытыми весами: 27B и 35B-A3B. APIYI направляет все пять моделей через официальный релей Aliyun / размещенный релей APIYI, совместимый с OpenAI Chat Completions. Закрытые уровни соответствуют политикам аутентификации и лимита запросов официального портала; уровни с открытыми весами размещены в официальном реле APIYI, поэтому клиентам не нужно арендовать GPU или разворачивать локальный inference.
🚀 Основные моменты: Max-Preview претендует на #1 в шести кодинговых бенчмарках, включая SWE-bench Pro и Terminal-Bench 2.0; Flash — это MoE 35B-A3B с нативным мультимодальным контекстом 256K (расширяемым до 1M); Plus — рабочая лошадка 72B/18B-active с контекстным окном 1M. Открытые веса qwen3.6-27b (dense 27B) и qwen3.6-35b-a3b (MoE 35B / 3B active) размещены в официальном реле APIYI — аренда GPU не требуется, оплата по token. Создано для coding-агентов, RAG с длинным контекстом, мультимодальной маршрутизации и рабочих нагрузок, чувствительных к требованиям комплаенса и нуждающихся в проверяемых весах.

Закрытые production-уровни (официальный релей Aliyun)

qwen3.6-max-preview

Флагман для кодинга#1 в 6 кодинговых бенчмарках; AIME 2025 93%, GPQA 86%, LiveCodeBench 79%.

qwen3.6-flash

Мультимодальный, ориентированный на скоростьMoE 35B-A3B, нативный ввод текста / изображений / видео, базовый контекст 256K с расширением до 1M.

qwen3.6-plus

Сбалансированная рабочая лошадка72B всего / 18B active, контекст 1M, Terminal-Bench 61.6 превосходит Claude Opus 4.5.

Уровни с открытыми весами (размещены APIYI · без аренды GPU)

qwen3.6-27b

27B dense · мощный инструмент для кодингаОткрытый релиз команды Qwen (Hugging Face Qwen/Qwen3.6-27B). Возможности кодинга сопоставимы с моделями класса 397B. Размещается в официальном реле APIYI — локальные GPU не требуются.

qwen3.6-35b-a3b

Открытая MoE-модель 35B-A3BОткрытый релиз команды Qwen (Hugging Face Qwen/Qwen3.6-35B-A3B); та же линия, что и у закрытого Flash, но другой уровень распространения. Всего 3B активных параметров — чрезвычайно низкая вычислительная стоимость.

Почему Qwen3.6 от APIYI через официальный релей Aliyun?

Сверено с официальным каналом Alibaba Cloud Bailian, с глубокой оптимизацией для корпоративного продакшена по параметрам стабильности, стоимости и удобства интеграции:

Официальный релей Aliyun

Передается через официальный канал Alibaba Cloud Bailian. Политики авторизации и лимита запросов совпадают с официальным порталом — низкая задержка внутри страны, SLA корпоративного уровня.

Без лимита на параллельные запросы · масштабируйтесь свободно

Нет жестких потолков RPM / TPM (при условии доступности upstream). Корпоративные клиенты могут масштабироваться по требованию; доступны тикеты и выделенные каналы для координации при высокой параллельной нагрузке.

Соответствие прайсу + ~15% скидки через пополнение

Официальная цена совпадает с тарифом Alibaba Cloud. Сочетайте с бонусами за пополнение, чтобы получить эффективную цену за единицу около 85% от прайса.

Глобальный доступ без лишних сложностей

Не требуется зарубежный сервер или proxy. Внутренние дата-центры, домашний широкополосный интернет и зарубежные узлы могут напрямую подключаться к api.apiyi.com — перенос за рубеж не требуется.

Полная экосистема, совместимая с OpenAI

Совместимо с OpenAI Chat Completions. Легко переключайтесь между GPT / Claude / DeepSeek / GLM и другими через APIYI единый каталог моделей.

Профессиональный сервис · корпоративная поддержка

Глубокая экспертиза в выборе моделей и рабочих процессах Agent; полная поддержка на этапах PoC → canary → production для корпоративных клиентов.

Как выбрать среди пяти

Max-Preview · программирование и сложное рассуждение

Сценарии: драйвер Coding Agent, реальные задачи по разработке ПО (класс SWE-Verified), основной моделью в рабочем процессе Cursor / Claude Code.Бенчмарки: SWE-bench Pro 58.4 (превышает 56.6 у GLM-5.1), AIME 2025 93%, GPQA 86%, LiveCodeBench 79%, Terminal-Bench 2.0 — #1.Примечание: помечен как Preview — веса еще дорабатываются. Сначала прогоните небольшой канареечный запуск, прежде чем переводить основной трафик.

Flash · мультимодальность большого объема и длинный контекст

Сценарии: понимание изображений / видео, суммаризация длинных документов, массовый перевод, полная синтезация документа после RAG.Архитектура: 35B total / 3B active MoE (35B-A3B), нативный контекст 256K, расширяемый до 1M tokens.Мультимодальность: нативный ввод текста / изображений / видео. Цена за единицу примерно в 1/8 от Max.

Plus · сбалансированный рабочий вариант

Сценарии: повседневные диалоги, поддержка клиентов, генерация контента, вопросы и ответы по корпоративной базе знаний, рассуждение средней сложности.Архитектура: 72B total / 18B active MoE — скорость инференса примерно в 3 раза выше, чем у Claude Opus 4.6.Бенчмарки: Terminal-Bench 2.0 на уровне 61.6 превосходит Claude Opus 4.5 (59.3); SWE-bench Verified 78.8.

qwen3.6-27b · мощный вариант для программирования с открытыми весами

Сценарии: помощь в программировании, чувствительная к стоимости; этап проверки API перед переходом к локальному развертыванию; клиенты с требованиями к соблюдению норм для аудируемых лицензий с открытым исходным кодом.Примечания: 27B dense, open weights, способность к программированию сопоставима с моделями класса 397B. Размещается в APIYI — без локального GPU.

qwen3.6-35b-a3b · быстрый MoE с открытыми весами

Сценарии: высокочастотные недорогие рабочие процессы; переходный этап перед переходом к self-hosted inference; проекты, которым нужны загружаемые веса для соответствия требованиям.Примечания: та же линия, что и у закрытого Flash (35B total / 3B active). Открытая версия размещается в APIYI — без аренды GPU, развертывания и эксплуатации.

Рекомендуемая маршрутизация

Стратегия: по умолчанию Flash + Plus при эскалации + Max-Preview как верхний предел; переходите на уровни с открытыми весами 27b / 35b-a3b для задач, где критична стоимость.Направляйте обычные диалоги и мультимодальные батчи в Flash; переводите в Plus для более сильного рассуждения; резервируйте Max-Preview для Coding Agent, сложного рассуждения и многошагового планирования; переходите на уровни с открытыми весами, когда важнее всего стоимость или требуются проверяемые веса.

Цены

Все пять моделей тарифицируются по схеме pay-as-you-go - Chat. Закрытые уровни (Max-Preview / Flash / Plus) используют ступенчатую тарификацию, привязанную к общему числу input token в одном запросе. Открытые уровни (27b / 35b-a3b) тарифицируются по единой фиксированной ставке — без уровней. Розничные цены соответствуют официальным тарифам Alibaba Cloud; бонус за пополнение в APIYI снижает эффективную цену за единицу примерно до 85% от розничной.

qwen3.6-max-preview

qwen3.6-flash

qwen3.6-plus

qwen3.6-27b (open-weight · размещается APIYI)

qwen3.6-35b-a3b (open-weight · размещается APIYI)

Примечания к ценам:
  • Закрытые уровни (ступенчатая тарификация): уровень определяется общим числом input token в одном запросе. Все token в этом запросе (input + output) тарифицируются по ставке этого уровня. Кросс-уровневого пропорционального расчета нет — например, запрос Flash с 300K input token попадает в 256K – 1000K, и весь запрос тарифицируется по $0.68 / $4.08, а не разбивается на «первые 256K по низкой цене, оставшиеся 44K по более высокому уровню».
  • Открытые уровни (фиксированная тарификация): qwen3.6-27b и qwen3.6-35b-a3b размещаются через официальный релей APIYI — без уровней. Клиентам не нужно арендовать GPU или запускать локальный inference; расчет идет напрямую по фактическому потреблению token.
  • Розничные цены соответствуют Bailian в Alibaba Cloud. С бонусами за пополнение эффективная цена за единицу составляет примерно 85% от розничной.
  • Тарификация за cache-hit сейчас отдельно не раскрывается; используется базовый уровень.

Спецификации

Закрытые production-уровни

Тиры с открытыми весами (размещаемые APIYI)

Почему размещаемые open-weights: checkpoints с открытыми весами можно свободно скачать, но для их запуска нужны GPU, VRAM и эксплуатация. APIYI размещает эти открытые веса на своем официальном релей, поэтому вы вызываете API напрямую — сохраняя преимущества «проверяемые веса, контролируемая лицензия» и избавляясь от затрат на аренду, развёртывание и эксплуатацию.

Эндпоинты

Домен: api.apiyi.com — основной шлюз. Альтернативные шлюзы, такие как b.apiyi.com / vip.apiyi.com, возвращают идентичные ответы. Установите base_url в https://api.apiyi.com/v1, чтобы напрямую использовать OpenAI / OpenAI-compatible SDK.

Примеры кода

Python (совместимо с OpenAI SDK)

Node.js

cURL

Рекомендации

1

Выбирайте подходящий уровень для каждой задачи

По умолчанию используйте Flash для обычного диалога / классификации / пакетной обработки мультимодальных запросов. Используйте Plus для рассуждений средней сложности и вопросов и ответов по корпоративной базе знаний. Переходите на Max-Preview только для кодирующих агентов, сложного планирования или математического рассуждения уровня соревнований. Понижайте уровень, когда это возможно.
2

Оцените границу уровня

Оцените количество входных token по P95 перед запуском. При превышении 128K для Max-Preview или 256K для Flash / Plus цена резко возрастает. Сводите в краткое содержание / разбивайте чрезмерно длинный контекст на части, чтобы удержать P95 в нижнем уровне.
3

Пакетная обработка мультимодальных запросов

Flash поддерживает контекст 1M и ввод видео, но один сверхдлинный запрос переводит его на более высокий уровень. Разбейте длинное видео на сегменты, затем подавайте его частями в пределах 256K, чтобы контролировать стоимость каждого вызова.
4

Канареечный запуск Preview

qwen3.6-max-preview — это Preview-сборка — веса все еще дорабатываются. Для критически важных путей сначала выполните небольшой канареечный запуск с A/B-сравнением, прежде чем переводить основной трафик.
5

Инструменты и потоковая передача

Все три модели поддерживают OpenAI-стиль tools и stream: true. Вы можете встроить их в существующие фреймворки Agent, совместимые с OpenAI (OpenClaw, LangChain, LlamaIndex и т. д.), без переписывания логики вызова инструментов.
6

Совмещайте с бонусами за пополнение

Прайсовые цены уже соответствуют официальному тарифу Alibaba. В сочетании с бонусами за пополнение эффективная цена за единицу составляет около 85% от прайса. Более крупные пополнения ($1,000+) дают более высокий коэффициент бонуса — пополняйте реже и большими суммами, чтобы получить лучшую маржу.

Ошибки и повторные попытки

Рекомендации для клиента:
  • Установите timeout запроса на ≥ 120 seconds (рассуждение Max-Preview и длинный context window в Plus занимают больше времени)
  • Применяйте экспоненциальную задержку повторных попыток для 5xx и timeout (рекомендуется 2 попытки)
  • Логируйте заголовок ответа x-request-id для диагностики

Часто задаваемые вопросы

Да. Все пять используют /v1/chat/completions (совместимый с OpenAI Chat Completions). Отличается только поле model (qwen3.6-max-preview / qwen3.6-flash / qwen3.6-plus / qwen3.6-27b / qwen3.6-35b-a3b) — переключайтесь в одной и той же кодовой базе по мере необходимости.
Три основных различия: (1) Загружаемые weights — open-weight checkpoints находятся на Hugging Face для внутреннего аудита, подачи документов по compliance или будущей миграции к локальному inference; (2) Размещенные вычисления — APIYI размещает open weights на своем official relay, так что вы просто вызываете API, без аренды GPU / развертывания / эксплуатации; (3) Более простая тарификация — у open-weight уровней фиксированная цена, без уровней, легче планировать бюджет. По возможностям: 35B-A3B имеет общую линию происхождения с закрытым Flash (другой уровень распространения); 27B — независимая dense-модель, чьи возможности в coding сопоставимы с моделями, у которых число параметров намного выше.
Самостоятельный хостинг open large model требует как минимум: достаточно мощные GPU (для 27B нужен минимум один A100 40G; 35B-A3B требует больше VRAM), inference framework (vLLM / TensorRT-LLM), мониторинг, failover и pipeline обновлений. Размещенный APIYI official relay берет все это на себя — тарификация по token, масштабирование по запросу и тот же OpenAI-compatible SDK, что и у closed-source уровней. Разрабатывайте с API; позже решите, переходить ли на self-hosting. Переход останется плавным.
Уровень определяется по общему числу input tokens в одном запросе. Все tokens (input + output) в этом запросе тарифицируются по ставке соответствующего уровня. Пример: запрос к Flash с 300K input tokens попадает в 256K – 1000K и тарифицируется целиком по $0.68 / $4.08 — без разделения на «первые 256K дешево, оставшиеся 44K дороже».
Да, но сначала проведите canary. Команда Qwen заявила, что последующие ревизии продолжат дорабатывать weights. Для критических путей проведите A/B test на ваших benchmark-задачах и переводите основной трафик только после выхода стабильной версии.
Используйте формат, совместимый с Vision от OpenAI: в messages передавайте content как массив, где каждый элемент — это {type: "text", text: ...} или {type: "image_url", image_url: {url: ...}}. Для видео следуйте полям video_url / frame-sampling из официальной документации.
Прайсовая цена совпадает с официальным тарифом. Разница в том, что APIYI добавляет бонусы за пополнение, поэтому эффективная цена за единицу составляет около 85% от прайса, а также предоставляет единый аккаунт, поддерживающий всю экосистему, совместимую с OpenAI (GPT / Claude / Gemini / DeepSeek / GLM и т. д.) — не нужно вести несколько аккаунтов у разных вендоров.
Да. Все три модели принимают стандартные для OpenAI tools / tool_choice. Вы можете повторно использовать существующую логику tool-calling в Agent-framework. Max-Preview особенно хорош в многошаговых вызовах tools и долгосрочном планировании.
Max-Preview автоматически включает CoT на задачах рассуждения; у Plus CoT всегда включен; Flash в первую очередь ориентирован на скорость и по умолчанию не выводит CoT. Названия полей следуют формату ответа Alibaba Cloud (reasoning_content и т. д.).
Flash и Plus ограничены 1M tokens; Max-Preview — 262K. При превышении лимита возвращается 400. Перед отправкой применяйте summarization / chunking / RAG retrieval — не пытайтесь отправить все одним вызовом.
Да. Задайте base_url как https://api.apiyi.com/v1 и передайте любой из идентификаторов моделей выше как model — миграция без кода.
Ошибки на стороне клиента 4xx (ошибка параметров / сбой авторизации / блокировка модерацией контента) не тарифицируются. Серверные ошибки 5xx, которые не доходят до inference, также не тарифицируются. Запросы, которые успешно возвращают tokens, тарифицируются по фактическому числу tokens, даже если клиент отменяет их в середине stream.

Связанные документы

Итог: Серия Qwen3.6 охватывает весь спектр спроса — от тяжёлых coding agent до высокообъёмной мультимодальной диспетчеризации. Max-Preview поднимает отечественное кодирование на новую высоту; Flash резко снижает цену за единицу для мультимодальных workloads с длинным контекстом; Plus — надёжная сбалансированная рабочая лошадка; открытые варианты 27B и 35B-A3B, размещённые через официальный релей APIYI, замыкают цикл на «управляемых open weights без аренды GPU». Все пять моделей используют endpoint, совместимый с OpenAI Chat, имеют прайс, сопоставимый с официальным тарифом, и в сочетании с бонусами за пополнение обеспечивают примерно 85% от прайса — лучший на сегодня вариант по соотношению цены и производительности в канале официального реле Aliyun.