Skip to main content
Qwen3.6 — это семейство моделей нового поколения Alibaba Tongyi Qianwen, выпущенное во 2 квартале 2026 года в рамках трех закрытых production-уровней — Max (флагман), Plus (сбалансированный), Flash (ориентированный на скорость) — плюс двух вариантов с открытыми весами: 27B и 35B-A3B. APIYI направляет все пять моделей через официальный релей Aliyun / релей, размещенный APIYI, совместимый с OpenAI Chat Completions. Закрытые уровни соответствуют политикам авторизации и лимита запросов официального портала; уровни с открытыми весами размещены в официальном релей APIYI, поэтому клиентам не нужно арендовать GPU или разворачивать локальный inference.
🚀 Ключевые особенности: Max-Preview заявляет #1 по шести бенчмаркам для программирования, включая SWE-bench Pro и Terminal-Bench 2.0; Flash — это 35B-A3B MoE с нативным мультимодальным контекстом 256K (расширяемым до 1M); Plus — рабочая лошадка с 72B/18B active и контекстным окном 1M. Открытые qwen3.6-27b (27B dense) и qwen3.6-35b-a3b (35B MoE / 3B active) размещены в официальном релей APIYI — аренда GPU не требуется, тарификация по token. Создано для coding-агентов, RAG с длинным контекстом, мультимодальной маршрутизации и нагрузок, чувствительных к требованиям compliance, которым нужны проверяемые веса.

Закрытые production-уровни (официальный релей Aliyun)

qwen3.6-max-preview

Флагман для coding#1 по 6 бенчмаркам для программирования; AIME 2025 93%, GPQA 86%, LiveCodeBench 79%.

qwen3.6-flash

Мультимодальный вариант, ориентированный на скорость35B-A3B MoE, нативный ввод текста / изображений / видео, базовый контекст 256K, расширяемый до 1M.

qwen3.6-plus

Сбалансированная рабочая лошадка72B всего / 18B active, 1M контекст, Terminal-Bench 61.6 превосходит Claude Opus 4.5.

Уровни с открытыми весами (размещены APIYI · аренда GPU не требуется)

qwen3.6-27b

27B dense · мощная модель для codingОткрытый выпуск команды Qwen (Hugging Face Qwen/Qwen3.6-27B). Возможности coding сопоставимы с моделями класса 397B. Размещено в официальном релей APIYI — локальные GPU не требуются.

qwen3.6-35b-a3b

35B-A3B MoE с открытыми весамиОткрытый выпуск команды Qwen (Hugging Face Qwen/Qwen3.6-35B-A3B); та же линия, что и у закрытого Flash, но другой уровень распространения. Только 3B active params — крайне низкие вычислительные затраты.

Почему Qwen3.6 от APIYI через официальный релей Aliyun?

Сверено с официальным каналом Alibaba Cloud Bailian, с глубокой оптимизацией для корпоративной эксплуатации по направлениям стабильности, стоимости и удобства интеграции:

Официальный релей Aliyun

Маршрутизация через официальный канал Alibaba Cloud Bailian. Политики Auth и лимита запросов совпадают с официальным порталом — низкая задержка внутри страны, SLA уровня enterprise.

Без лимита на параллельные запросы · масштабируйте свободно

Нет жестких верхних границ RPM / TPM (в пределах доступности у upstream). Корпоративные клиенты могут масштабироваться по запросу; для координации высокой параллельности доступны тикеты и выделенные каналы.

Соответствие прайс-листу + ~15% скидки через пополнение

Прайсовая цена совпадает с официальным тарифом Alibaba Cloud. Сочетайте с бонусами за пополнение, чтобы получить эффективную цену за единицу около 85% от прайса.

Глобальный доступ без лишних сложностей

Не требуется зарубежный сервер или прокси. Локальные дата-центры, домашний broadband и зарубежные узлы могут подключаться напрямую к api.apiyi.com — переезд за рубеж не нужен.

Полная экосистема, совместимая с OpenAI

Совместимо с OpenAI Chat Completions. Без труда переключайтесь между GPT / Claude / DeepSeek / GLM и другими через APIYI’s единый каталог моделей.

Профессиональный сервис · корпоративная поддержка

Глубокая экспертиза в выборе модели и рабочих процессах Agent; полная поддержка для корпоративных клиентов на этапах PoC → canary → production.

Как выбрать среди пяти

Max-Preview · кодирование и сложное рассуждение

Сценарии: драйвер Coding Agent, реальные задачи по разработке ПО (класс SWE-Verified), основная модель для рабочих процессов Cursor / Claude Code.Метрики: SWE-bench Pro 58.4 (выше, чем 56.6 у GLM-5.1), AIME 2025 93%, GPQA 86%, LiveCodeBench 79%, Terminal-Bench 2.0 #1.Примечание: помечено как Preview — веса все еще дорабатываются. Прогоните небольшой canary перед переключением основного трафика.

Flash · мультимодальный длинный контекст для больших объемов

Сценарии: понимание изображений / видео, суммаризация длинных документов, массовый перевод, полная синтезация документа после RAG.Архитектура: 35B всего / 3B активных MoE (35B-A3B), нативное контекстное окно 256K, расширяемое до 1M tokens.Мультимодальность: нативный ввод текста / изображений / видео. Цена за единицу примерно в 1/8 от Max.

Plus · сбалансированная рабочая лошадка

Сценарии: ежедневный диалог, поддержка клиентов, генерация контента, корпоративный Q&A по базе знаний, рассуждение средней сложности.Архитектура: 72B всего / 18B активных MoE — скорость inference примерно в 3× выше, чем у Claude Opus 4.6.Метрики: Terminal-Bench 2.0 с результатом 61.6 превосходит Claude Opus 4.5 (59.3); SWE-bench Verified 78.8.

qwen3.6-27b · мощный вариант для кодирования с открытыми весами

Сценарии: помощь в кодировании с учетом стоимости; этап проверки API перед переходом к локальному развёртыванию; клиенты с требованиями к compliance и проверяемым лицензиям open-source.Примечания: 27B dense, открытые веса, качество кодирования сопоставимо с моделями класса 397B. Размещается на APIYI — локальная GPU не нужна.

qwen3.6-35b-a3b · MoE с открытыми весами и высокой скоростью

Сценарии: рабочие процессы с высокой частотой и низкой стоимостью; переходный этап перед переносом на self-hosted inference; проекты, которым нужны загружаемые веса по требованиям compliance.Примечания: та же линия, что и у закрытого Flash (35B всего / 3B активных). Версия с открытыми весами размещается на APIYI — можно обойтись без аренды GPU, развёртывания и эксплуатации.

Рекомендуемая маршрутизация

Стратегия: Flash по умолчанию + Plus при эскалации + Max-Preview как верхний предел; переходите на open-weight 27b / 35b-a3b для рабочих нагрузок, максимально чувствительных к стоимости.Направляйте обычный диалог и мультимодальные пакеты в Flash; эскалируйте до Plus для более сильного рассуждения; оставляйте Max-Preview для Coding Agent, сложного рассуждения и многошагового планирования; переходите на уровни с открытыми весами, когда стоимость важнее всего или нужны веса, пригодные для аудита.

Тарификация

Все пять моделей тарифицируются по схеме оплата по мере использования - Chat. Закрытые уровни (Max-Preview / Flash / Plus) используют многоуровневую тарификацию, привязанную к общему количеству input token в одном запросе. Уровни open-weight (27b / 35b-a3b) тарифицируются по единой фиксированной ставке — без уровней. Листовые цены соответствуют официальной ставке Alibaba Cloud; бонус за пополнение APIYI снижает фактическую цену за единицу примерно до 85% от листовой.

qwen3.6-max-preview

qwen3.6-flash

qwen3.6-plus

qwen3.6-27b (open-weight · размещается APIYI)

qwen3.6-35b-a3b (open-weight · размещается APIYI)

Примечания по тарификации:
  • Закрытые уровни (многоуровневая тарификация): уровень определяется по общему количеству input token одного запроса. Все token в этом запросе (входные + выходные) тарифицируются по ставке соответствующего уровня. Без пропорционального распределения между уровнями — например, запрос Flash с 300K input token попадает в 256K – 1000K, и весь запрос тарифицируется по $0.68 / $4.08, а не делится как «первые 256K дешево, оставшиеся 44K по более высокой ставке».
  • Уровни open-weight (фиксированная тарификация): qwen3.6-27b и qwen3.6-35b-a3b размещаются на официальном реле APIYI — без уровней. Клиентам не нужно арендовать GPU или запускать локальный inference; расчет ведется напрямую по фактическому потреблению token.
  • Листовые цены соответствуют Alibaba Cloud Bailian. С учетом бонусов за пополнение фактическая цена за единицу составляет примерно 85% от листовой.
  • Тарификация за cache-hit сейчас не раскрывается отдельно; применяется базовый уровень.

Спецификации

Промышленные уровни с закрытым исходным кодом

Уровни open-weight (размещенные на APIYI)

Почему размещенные open-weights: open-weight checkpoints можно свободно скачать, но для их запуска нужны GPU, VRAM и ops. APIYI размещает эти open weights на своем официальном релейе, так что вы вызываете API напрямую — сохраняя преимущество «проверяемые веса, контролируемая лицензия» и избегая затрат на аренду, развертывание и ops.

Эндпоинты

Домен: api.apiyi.com — основной шлюз. Альтернативные шлюзы, такие как b.apiyi.com / vip.apiyi.com, возвращают идентичные ответы. Установите base_url в https://api.apiyi.com/v1, чтобы напрямую использовать OpenAI / OpenAI-compatible SDK.

Примеры кода

Python (совместимый с OpenAI SDK)

Node.js

cURL

Лучшие практики

1

Выбирайте правильный уровень под задачу

По умолчанию используйте Flash для обычных диалогов / классификации / пакетной обработки мультимодальных запросов. Используйте Plus для рассуждения средней сложности и вопросов и ответов по корпоративной базе знаний. Переходите на Max-Preview только для агентов для программирования, сложного планирования или математического рассуждения уровня соревнований. Снижайте уровень, когда это возможно.
2

Оцените порог перехода между уровнями

Перед запуском измерьте P95 по числу input token. При превышении 128K у Max-Preview или 256K у Flash / Plus цена резко возрастает. Сокращайте / разбивайте слишком длинный контекст, чтобы P95 оставался в нижнем уровне.
3

Пакетная обработка мультимодальных запросов

Flash поддерживает контекст 1M и видео на входе, но один сверхдлинный запрос переводит вас в более высокий уровень. Разбейте длинное видео на сегменты, затем передавайте его частями в пределах 256K, чтобы контролировать стоимость каждого вызова.
4

Канареечная проверка Preview

qwen3.6-max-preview — это сборка Preview: веса еще дорабатываются. Для критически важных путей запустите небольшую канареечную проверку с A/B-сравнением перед переключением основного трафика.
5

Инструменты и потоковая передача

Все три модели поддерживают tools и stream: true в стиле OpenAI. Вы можете встроить их в существующие Agent-фреймворки, совместимые с OpenAI (OpenClaw, LangChain, LlamaIndex и т. д.), без переписывания логики вызова инструментов.
6

Совмещайте с бонусами за пополнение

Цены прайса уже соответствуют официальному тарифу Alibaba. В сочетании с бонусами за пополнение эффективная цена за единицу составляет около 85% от прайса. Более крупные пополнения ($1,000+) дают более высокий коэффициент бонуса — пополняйте реже и на большие суммы, чтобы получить лучшую маржу.

Ошибки и повторные попытки

Рекомендации для клиента:
  • Установите таймаут запроса на ≥ 120 seconds (рассуждение Max-Preview и длинный контекст Plus занимает больше времени)
  • Применяйте экспоненциальную задержку повторных попыток для 5xx и timeout (рекомендуется 2 попытки)
  • Логируйте заголовок ответа x-request-id для устранения неполадок

Частые вопросы

Да. Все пять используют /v1/chat/completions (совместимый с OpenAI Chat Completions). Отличается только поле model (qwen3.6-max-preview / qwen3.6-flash / qwen3.6-plus / qwen3.6-27b / qwen3.6-35b-a3b) — при необходимости переключайтесь в той же кодовой базе.
Три основных отличия: (1) Загружаемые веса — open-weight checkpoints доступны на Hugging Face для внутреннего аудита, подачи материалов по комплаенсу или будущей миграции на локальный inference; (2) Хостинг вычислений — APIYI размещает open weights на своем официальном реле, так что вы просто вызываете API, без аренды GPU / развертывания / ops; (3) Более простая тарификация — open-weight уровни используют фиксированное ценообразование, без уровней, что упрощает планирование бюджета. По возможностям: 35B-A3B имеет общую родословную с закрытым Flash (другой уровень распределения); 27B — независимая dense-модель, чьи возможности в кодинге сопоставимы с моделями с гораздо большим числом параметров.
Самостоятельный хостинг большой open-модели требует как минимум: мощных GPU (для 27B нужен минимум один A100 40G; для 35B-A3B требуется больше VRAM), фреймворка для inference (vLLM / TensorRT-LLM), мониторинга, failover и pipeline обновлений. Официальный hosted relay от APIYI берет это на себя — тарификация по token, масштабирование по demand и тот же совместимый с OpenAI SDK, что и у закрытых уровней. Разрабатывайте через API, а позже решите, переходить ли на self-hosting. Переход остается плавным.
Уровень определяется по общему числу input token одного запроса. Все token (input + output) в этом запросе тарифицируются по ставке соответствующего уровня. Пример: запрос к Flash с 300K input token попадает в 256K – 1000K и тарифицируется для всего запроса по $0.68 / $4.08 — без разделения на «первые 256K дешево, оставшиеся 44K дороже».
Да, но сначала запустите canary. Команда Qwen заявляла, что последующие revisions будут и дальше уточнять веса. Для критичных сценариев проведите A/B-тест на ваших benchmark-задачах и переключайте основной трафик только после выхода стабильной версии.
Используйте совместимый с Vision формат OpenAI: в messages передавайте content как массив, где каждый элемент — это {type: "text", text: ...} или {type: "image_url", image_url: {url: ...}}. Для видео следуйте полям video_url / frame-sampling из официальной документации.
Прайс-лист совпадает с официальным тарифом. Отличие в том, что APIYI добавляет бонусы за пополнение, и эффективная цена за unit получается примерно 85% от прайса, плюс единый аккаунт, который поддерживает всю совместимую с OpenAI экосистему (GPT / Claude / Gemini / DeepSeek / GLM и т. д.) — не нужно поддерживать несколько аккаунтов разных вендоров.
Да. Все три модели принимают стандартные для OpenAI tools / tool_choice. Вы можете переиспользовать существующую логику tool-calling из Agent-framework. Max-Preview особенно хорошо подходит для многошаговых вызовов tools и долгосрочного планирования.
Max-Preview автоматически включает CoT для задач на reasoning; у Plus CoT всегда включен; Flash ориентирован на скорость и по умолчанию не выводит CoT. Имена полей соответствуют формату ответа Alibaba Cloud (reasoning_content и т. д.).
У Flash и Plus лимит — 1M token; у Max-Preview — 262K. При превышении лимита возвращается 400. Перед отправкой применяйте summarization / chunking / RAG retrieval — не пытайтесь отправить все одним запросом.
Да. Установите base_url в https://api.apiyi.com/v1 и передайте любой из указанных выше model IDs как model — миграция без изменения кода.
Ошибки на стороне клиента 4xx (ошибка параметров / сбой авторизации / блокировка moderation контента) не тарифицируются. Ошибки 5xx на стороне сервера, при которых запрос не доходит до inference, тоже не тарифицируются. Запросы, которые успешно возвращают token, тарифицируются по фактическому числу token, даже если клиент отменил их в середине stream.

Сопутствующие документы

Итог: Серия Qwen3.6 покрывает всю кривую спроса — от тяжелых coding agent’ов до высокообъемной мультимодальной маршрутизации. Max-Preview выводит отечественный coding на новый уровень; Flash резко снижает удельную цену мультимодальных задач с длинным контекстом; Plus остается надежной сбалансированной рабочей лошадкой; open-weight варианты 27B и 35B-A3B, размещенные в официальном релеe APIYI, замыкают цикл «контролируемые open weights без аренды GPU». Все пять используют один и тот же эндпоинт, совместимый с OpenAI Chat, по цене, совпадающей с официальным тарифом, и суммируются с бонусами за пополнение примерно до 85% от прайса — это лучшее на текущий момент сочетание цены и производительности в канале официального релея Aliyun.