> ## Documentation Index
> Fetch the complete documentation index at: https://docs.apiyi.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Серия текстовых моделей Qwen3.6

> Семейство Qwen3.6 на APIYI: флагман для кодинга Max-Preview + мультимодальная Flash с упором на скорость + сбалансированная рабочая лошадка Plus + варианты с открытыми весами 27B / 35B-A3B (размещены на APIYI — аренда GPU не требуется). Все запросы направляются через официальный релей Aliyun, совместимо с OpenAI Chat. Цены в списке соответствуют официальным тарифам Alibaba; бонус на пополнение от APIYI снижает эффективную цену за единицу примерно до 85% от списка.

Qwen3.6 — это семейство моделей нового поколения Alibaba Tongyi Qianwen, выпущенное во 2 квартале 2026 года в рамках трех закрытых production-уровней — **Max** (флагман), **Plus** (сбалансированный), **Flash** (ориентированный на скорость) — плюс двух вариантов с открытыми весами: **27B** и **35B-A3B**. APIYI направляет все пять моделей через **официальный релей Aliyun / релей, размещенный APIYI**, совместимый с OpenAI Chat Completions. Закрытые уровни соответствуют политикам авторизации и лимита запросов официального портала; **уровни с открытыми весами размещены в официальном релей APIYI, поэтому клиентам не нужно арендовать GPU или разворачивать локальный inference**.

<Note>
  **🚀 Ключевые особенности**: Max-Preview заявляет #1 по шести бенчмаркам для программирования, включая SWE-bench Pro и Terminal-Bench 2.0; Flash — это 35B-A3B MoE с нативным мультимодальным контекстом 256K (расширяемым до 1M); Plus — рабочая лошадка с 72B/18B active и контекстным окном 1M. Открытые **`qwen3.6-27b`** (27B dense) и **`qwen3.6-35b-a3b`** (35B MoE / 3B active) размещены в официальном релей APIYI — аренда GPU не требуется, тарификация по token. **Создано для coding-агентов, RAG с длинным контекстом, мультимодальной маршрутизации и нагрузок, чувствительных к требованиям compliance, которым нужны проверяемые веса**.
</Note>

### Закрытые production-уровни (официальный релей Aliyun)

<CardGroup cols={3}>
  <Card title="qwen3.6-max-preview" icon="trophy">
    **Флагман для coding**

    \#1 по 6 бенчмаркам для программирования; AIME 2025 93%, GPQA 86%, LiveCodeBench 79%.
  </Card>

  <Card title="qwen3.6-flash" icon="bolt">
    **Мультимодальный вариант, ориентированный на скорость**

    35B-A3B MoE, нативный ввод текста / изображений / видео, базовый контекст 256K, расширяемый до 1M.
  </Card>

  <Card title="qwen3.6-plus" icon="scale">
    **Сбалансированная рабочая лошадка**

    72B всего / 18B active, 1M контекст, Terminal-Bench 61.6 превосходит Claude Opus 4.5.
  </Card>
</CardGroup>

### Уровни с открытыми весами (размещены APIYI · аренда GPU не требуется)

<CardGroup cols={2}>
  <Card title="qwen3.6-27b" icon="box">
    **27B dense · мощная модель для coding**

    Открытый выпуск команды Qwen (Hugging Face `Qwen/Qwen3.6-27B`). Возможности coding сопоставимы с моделями класса 397B. Размещено в официальном релей APIYI — локальные GPU не требуются.
  </Card>

  <Card title="qwen3.6-35b-a3b" icon="boxes">
    **35B-A3B MoE с открытыми весами**

    Открытый выпуск команды Qwen (Hugging Face `Qwen/Qwen3.6-35B-A3B`); та же линия, что и у закрытого Flash, но другой уровень распространения. Только 3B active params — крайне низкие вычислительные затраты.
  </Card>
</CardGroup>

## Почему Qwen3.6 от APIYI через официальный релей Aliyun?

Сверено с официальным каналом Alibaba Cloud Bailian, с глубокой оптимизацией для корпоративной эксплуатации по направлениям **стабильности**, **стоимости** и **удобства интеграции**:

<CardGroup cols={2}>
  <Card title="Официальный релей Aliyun" icon="server">
    Маршрутизация через официальный канал Alibaba Cloud Bailian. Политики Auth и лимита запросов совпадают с официальным порталом — низкая задержка внутри страны, SLA уровня enterprise.
  </Card>

  <Card title="Без лимита на параллельные запросы · масштабируйте свободно" icon="infinity">
    Нет жестких верхних границ RPM / TPM (в пределах доступности у upstream). Корпоративные клиенты могут масштабироваться по запросу; для координации высокой параллельности доступны тикеты и выделенные каналы.
  </Card>

  <Card title="Соответствие прайс-листу + ~15% скидки через пополнение" icon="percent">
    Прайсовая цена совпадает с официальным тарифом Alibaba Cloud. Сочетайте с [бонусами за пополнение](/ru/faq/recharge-promotions), чтобы получить эффективную цену за единицу около **85% от прайса**.
  </Card>

  <Card title="Глобальный доступ без лишних сложностей" icon="globe">
    **Не требуется зарубежный сервер или прокси**. Локальные дата-центры, домашний broadband и зарубежные узлы могут подключаться напрямую к `api.apiyi.com` — переезд за рубеж не нужен.
  </Card>

  <Card title="Полная экосистема, совместимая с OpenAI" icon="layers">
    Совместимо с OpenAI Chat Completions. Без труда переключайтесь между GPT / Claude / DeepSeek / GLM и другими через APIYI's [единый каталог моделей](/ru/api-capabilities/model-info).
  </Card>

  <Card title="Профессиональный сервис · корпоративная поддержка" icon="handshake">
    Глубокая экспертиза в выборе модели и рабочих процессах Agent; полная поддержка для корпоративных клиентов на этапах PoC → canary → production.
  </Card>
</CardGroup>

## Как выбрать среди пяти

<CardGroup cols={2}>
  <Card title="Max-Preview · кодирование и сложное рассуждение" icon="trophy">
    **Сценарии**: драйвер Coding Agent, реальные задачи по разработке ПО (класс SWE-Verified), основная модель для рабочих процессов Cursor / Claude Code.

    **Метрики**: SWE-bench Pro 58.4 (выше, чем 56.6 у GLM-5.1), AIME 2025 93%, GPQA 86%, LiveCodeBench 79%, Terminal-Bench 2.0 #1.

    **Примечание**: помечено как Preview — веса все еще дорабатываются. Прогоните небольшой canary перед переключением основного трафика.
  </Card>

  <Card title="Flash · мультимодальный длинный контекст для больших объемов" icon="bolt">
    **Сценарии**: понимание изображений / видео, суммаризация длинных документов, массовый перевод, полная синтезация документа после RAG.

    **Архитектура**: 35B всего / 3B активных MoE (35B-A3B), нативное контекстное окно 256K, расширяемое до 1M tokens.

    **Мультимодальность**: нативный ввод текста / изображений / видео. Цена за единицу примерно в 1/8 от Max.
  </Card>

  <Card title="Plus · сбалансированная рабочая лошадка" icon="scale">
    **Сценарии**: ежедневный диалог, поддержка клиентов, генерация контента, корпоративный Q\&A по базе знаний, рассуждение средней сложности.

    **Архитектура**: 72B всего / 18B активных MoE — скорость inference примерно в 3× выше, чем у Claude Opus 4.6.

    **Метрики**: Terminal-Bench 2.0 с результатом 61.6 превосходит Claude Opus 4.5 (59.3); SWE-bench Verified 78.8.
  </Card>

  <Card title="qwen3.6-27b · мощный вариант для кодирования с открытыми весами" icon="box">
    **Сценарии**: помощь в кодировании с учетом стоимости; этап проверки API перед переходом к локальному развёртыванию; клиенты с требованиями к compliance и проверяемым лицензиям open-source.

    **Примечания**: 27B dense, открытые веса, качество кодирования сопоставимо с моделями класса 397B. Размещается на APIYI — локальная GPU не нужна.
  </Card>

  <Card title="qwen3.6-35b-a3b · MoE с открытыми весами и высокой скоростью" icon="boxes">
    **Сценарии**: рабочие процессы с высокой частотой и низкой стоимостью; переходный этап перед переносом на self-hosted inference; проекты, которым нужны загружаемые веса по требованиям compliance.

    **Примечания**: та же линия, что и у закрытого Flash (35B всего / 3B активных). Версия с открытыми весами размещается на APIYI — можно обойтись без аренды GPU, развёртывания и эксплуатации.
  </Card>

  <Card title="Рекомендуемая маршрутизация" icon="route">
    **Стратегия**: Flash по умолчанию + Plus при эскалации + Max-Preview как верхний предел; переходите на open-weight 27b / 35b-a3b для рабочих нагрузок, максимально чувствительных к стоимости.

    Направляйте обычный диалог и мультимодальные пакеты в Flash; эскалируйте до Plus для более сильного рассуждения; оставляйте Max-Preview для Coding Agent, сложного рассуждения и многошагового планирования; переходите на уровни с открытыми весами, когда стоимость важнее всего или нужны веса, пригодные для аудита.
  </Card>
</CardGroup>

## Тарификация

Все пять моделей тарифицируются по схеме **оплата по мере использования - Chat**. Закрытые уровни (Max-Preview / Flash / Plus) используют **многоуровневую тарификацию**, привязанную к общему количеству input token в одном запросе. Уровни open-weight (27b / 35b-a3b) тарифицируются по **единой фиксированной ставке — без уровней**. Листовые цены соответствуют официальной ставке Alibaba Cloud; бонус за пополнение APIYI снижает фактическую цену за единицу примерно до **85% от листовой**.

### qwen3.6-max-preview

| Входные token одного запроса | Цена входа          | Цена выхода          |
| ---------------------------- | ------------------- | -------------------- |
| **0 – 128K**                 | \$1.2800 / 1M token | \$7.6800 / 1M token  |
| **128K – 256K**              | \$2.1200 / 1M token | \$12.7200 / 1M token |

### qwen3.6-flash

| Входные token одного запроса | Цена входа          | Цена выхода         |
| ---------------------------- | ------------------- | ------------------- |
| **0 – 256K**                 | \$0.1700 / 1M token | \$1.0200 / 1M token |
| **256K – 1000K**             | \$0.6800 / 1M token | \$4.0800 / 1M token |

### qwen3.6-plus

| Входные token одного запроса | Цена входа          | Цена выхода         |
| ---------------------------- | ------------------- | ------------------- |
| **0 – 256K**                 | \$0.3000 / 1M token | \$1.8000 / 1M token |
| **256K – 1000K**             | \$1.2000 / 1M token | \$7.2000 / 1M token |

### qwen3.6-27b (open-weight · размещается APIYI)

| Тарификация                     | Цена входа          | Цена выхода         |
| ------------------------------- | ------------------- | ------------------- |
| **Фиксированная (без уровней)** | \$0.4200 / 1M token | \$2.5200 / 1M token |

### qwen3.6-35b-a3b (open-weight · размещается APIYI)

| Тарификация                     | Цена входа          | Цена выхода         |
| ------------------------------- | ------------------- | ------------------- |
| **Фиксированная (без уровней)** | \$0.2600 / 1M token | \$1.5600 / 1M token |

<Info>
  **Примечания по тарификации**:

  * **Закрытые уровни (многоуровневая тарификация)**: уровень определяется по **общему количеству input token одного запроса**. Все token в этом запросе (входные + выходные) тарифицируются по ставке соответствующего уровня. **Без пропорционального распределения между уровнями** — например, запрос Flash с 300K input token попадает в `256K – 1000K`, и весь запрос тарифицируется по \$0.68 / \$4.08, а не делится как «первые 256K дешево, оставшиеся 44K по более высокой ставке».
  * **Уровни open-weight (фиксированная тарификация)**: `qwen3.6-27b` и `qwen3.6-35b-a3b` размещаются на официальном реле APIYI — без уровней. Клиентам не нужно арендовать GPU или запускать локальный inference; расчет ведется напрямую по фактическому потреблению token.
  * Листовые цены соответствуют Alibaba Cloud Bailian. С учетом [бонусов за пополнение](/ru/faq/recharge-promotions) фактическая цена за единицу составляет примерно **85% от листовой**.
  * Тарификация за cache-hit сейчас не раскрывается отдельно; применяется базовый уровень.
</Info>

## Спецификации

### Промышленные уровни с закрытым исходным кодом

| Параметр                                | qwen3.6-max-preview                                 | qwen3.6-flash                                      | qwen3.6-plus                                       |
| --------------------------------------- | --------------------------------------------------- | -------------------------------------------------- | -------------------------------------------------- |
| **ID модели**                           | `qwen3.6-max-preview`                               | `qwen3.6-flash`                                    | `qwen3.6-plus`                                     |
| **Архитектура**                         | Крупная плотная модель                              | MoE 35B-A3B                                        | MoE 72B / 18B активных                             |
| **Контекст**                            | 262K tokens                                         | 256K (расширяется до 1M)                           | 1M tokens                                          |
| **Модальности ввода**                   | Текст                                               | Текст / изображение / видео                        | Текст                                              |
| **Формат вывода**                       | Текст                                               | Текст                                              | Текст                                              |
| **Потоковая передача**                  | ✅ Поддерживается                                    | ✅ Поддерживается                                   | ✅ Поддерживается                                   |
| **Вызов функций / использование tools** | ✅ Поддерживается                                    | ✅ Поддерживается                                   | ✅ Поддерживается                                   |
| **Цепочка рассуждений**                 | ✅ Автоматически включается для задач с рассуждением | —                                                  | ✅ Всегда включено                                  |
| **Тарификация**                         | Chat с оплатой по факту использования (с уровнями)  | Chat с оплатой по факту использования (с уровнями) | Chat с оплатой по факту использования (с уровнями) |
| **Канал**                               | официальный релей Aliyun                            | официальный релей Aliyun                           | официальный релей Aliyun                           |

### Уровни open-weight (размещенные на APIYI)

| Параметр                                | qwen3.6-27b                                                        | qwen3.6-35b-a3b                                                    |
| --------------------------------------- | ------------------------------------------------------------------ | ------------------------------------------------------------------ |
| **ID модели**                           | `qwen3.6-27b`                                                      | `qwen3.6-35b-a3b`                                                  |
| **Архитектура**                         | плотная 27B                                                        | MoE: всего 35B / 3B активных                                       |
| **Лицензия**                            | open-weight команды Qwen (Hugging Face `Qwen/Qwen3.6-27B`)         | open-weight команды Qwen (Hugging Face `Qwen/Qwen3.6-35B-A3B`)     |
| **Контекст**                            | Соответствует официальной карточке весов                           | Соответствует официальной карточке весов                           |
| **Модальности ввода**                   | Текст                                                              | Текст                                                              |
| **Потоковая передача**                  | ✅ Поддерживается                                                   | ✅ Поддерживается                                                   |
| **Вызов функций / использование tools** | ✅ Поддерживается                                                   | ✅ Поддерживается                                                   |
| **Тарификация**                         | Chat с оплатой по факту использования (фиксированная, без уровней) | Chat с оплатой по факту использования (фиксированная, без уровней) |
| **Канал**                               | релей, размещенный на APIYI                                        | релей, размещенный на APIYI                                        |

<Tip>
  **Почему размещенные open-weights**: open-weight checkpoints можно свободно скачать, но для их запуска нужны GPU, VRAM и ops. **APIYI размещает эти open weights на своем официальном релейе**, так что вы вызываете API напрямую — сохраняя преимущество «проверяемые веса, контролируемая лицензия» и избегая затрат на аренду, развертывание и ops.
</Tip>

## Эндпоинты

| Эндпоинт               | Метод  | Content-Type       | Назначение                                                                                                   |
| ---------------------- | ------ | ------------------ | ------------------------------------------------------------------------------------------------------------ |
| `/v1/chat/completions` | `POST` | `application/json` | Диалог / рассуждение / использование tools (**общие для всех пяти моделей**, отличается только поле `model`) |

<Tip>
  **Домен**: `api.apiyi.com` — основной шлюз. Альтернативные шлюзы, такие как `b.apiyi.com` / `vip.apiyi.com`, возвращают идентичные ответы. Установите `base_url` в `https://api.apiyi.com/v1`, чтобы напрямую использовать OpenAI / OpenAI-compatible SDK.
</Tip>

## Примеры кода

### Python (совместимый с OpenAI SDK)

```python theme={null}
from openai import OpenAI

client = OpenAI(
    api_key="sk-your-api-key",
    base_url="https://api.apiyi.com/v1"
)

# Max-Preview: coding Agent driver
resp = client.chat.completions.create(
    model="qwen3.6-max-preview",
    messages=[
        {"role": "system", "content": "You are a senior Python engineer. Return changes as a unified diff."},
        {"role": "user", "content": "Add type hints and fix any latent bugs in this snippet ..."}
    ]
)
print(resp.choices[0].message.content)

# Flash: image + text multimodal input
resp = client.chat.completions.create(
    model="qwen3.6-flash",
    messages=[
        {"role": "user", "content": [
            {"type": "text", "text": "Describe the key information in this image."},
            {"type": "image_url", "image_url": {"url": "https://your-image-url.png"}}
        ]}
    ]
)
print(resp.choices[0].message.content)

# Plus: daily dialog and mid-complexity reasoning
resp = client.chat.completions.create(
    model="qwen3.6-plus",
    messages=[{"role": "user", "content": "Introduce yourself in one sentence."}]
)
print(resp.choices[0].message.content)
```

### Node.js

```javascript theme={null}
import OpenAI from 'openai';

const client = new OpenAI({
  apiKey: 'sk-your-api-key',
  baseURL: 'https://api.apiyi.com/v1',
});

const resp = await client.chat.completions.create({
  model: 'qwen3.6-plus',
  messages: [{ role: 'user', content: 'Introduce yourself in one sentence.' }],
});

console.log(resp.choices[0].message.content);
```

### cURL

```bash theme={null}
curl -X POST "https://api.apiyi.com/v1/chat/completions" \
  -H "Authorization: Bearer sk-your-api-key" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-max-preview",
    "messages": [
      {"role": "user", "content": "Explain what an MoE architecture is."}
    ]
  }'
```

## Лучшие практики

<Steps>
  <Step title="Выбирайте правильный уровень под задачу">
    По умолчанию используйте Flash для обычных диалогов / классификации / пакетной обработки мультимодальных запросов. Используйте Plus для рассуждения средней сложности и вопросов и ответов по корпоративной базе знаний. Переходите на Max-Preview только для агентов для программирования, сложного планирования или математического рассуждения уровня соревнований. Снижайте уровень, когда это возможно.
  </Step>

  <Step title="Оцените порог перехода между уровнями">
    Перед запуском измерьте P95 по числу input token. При превышении 128K у Max-Preview или 256K у Flash / Plus цена резко возрастает. Сокращайте / разбивайте слишком длинный контекст, чтобы P95 оставался в нижнем уровне.
  </Step>

  <Step title="Пакетная обработка мультимодальных запросов">
    Flash поддерживает контекст 1M и видео на входе, но один сверхдлинный запрос переводит вас в более высокий уровень. Разбейте длинное видео на сегменты, затем передавайте его частями в пределах 256K, чтобы контролировать стоимость каждого вызова.
  </Step>

  <Step title="Канареечная проверка Preview">
    `qwen3.6-max-preview` — это сборка Preview: веса еще дорабатываются. Для критически важных путей запустите небольшую канареечную проверку с A/B-сравнением перед переключением основного трафика.
  </Step>

  <Step title="Инструменты и потоковая передача">
    Все три модели поддерживают `tools` и `stream: true` в стиле OpenAI. Вы можете встроить их в существующие Agent-фреймворки, совместимые с OpenAI (OpenClaw, LangChain, LlamaIndex и т. д.), без переписывания логики вызова инструментов.
  </Step>

  <Step title="Совмещайте с бонусами за пополнение">
    Цены прайса уже соответствуют официальному тарифу Alibaba. В сочетании с [бонусами за пополнение](/ru/faq/recharge-promotions) эффективная цена за единицу составляет около **85% от прайса**. Более крупные пополнения (\$1,000+) дают более высокий коэффициент бонуса — пополняйте реже и на большие суммы, чтобы получить лучшую маржу.
  </Step>
</Steps>

## Ошибки и повторные попытки

| Status  | Значение                              | Что делать                                                                                            |
| ------- | ------------------------------------- | ----------------------------------------------------------------------------------------------------- |
| `400`   | Ошибка параметра / неизвестная model  | Проверьте написание `model`, форму `messages` и не превышает ли входные данные max context            |
| `401`   | Недействительный token                | Проверьте Bearer Token                                                                                |
| `403`   | Блокировка модерацией контента        | Измените prompts / reference inputs, чтобы избежать нарушений политики                                |
| `429`   | Лимит запросов / недостаточный баланс | Повторяйте с экспоненциальной задержкой; проверьте баланс аккаунта                                    |
| `5xx`   | Ошибка шлюза / backend                | Повторите 1–2 раза; если ошибка сохраняется, создайте тикет                                           |
| Timeout | Высокая задержка                      | Установите client timeout на **≥ 120s** (CoT или вызовы с длинным контекстом занимают больше времени) |

<Info>
  **Рекомендации для клиента**:

  * Установите таймаут запроса на **≥ 120 seconds** (рассуждение Max-Preview и длинный контекст Plus занимает больше времени)
  * Применяйте **экспоненциальную задержку повторных попыток** для 5xx и timeout (рекомендуется 2 попытки)
  * Логируйте заголовок ответа `x-request-id` для устранения неполадок
</Info>

## Частые вопросы

<AccordionGroup>
  <Accordion title="Все пять моделей используют один и тот же API endpoint?">
    Да. Все пять используют `/v1/chat/completions` (совместимый с OpenAI Chat Completions). Отличается только поле `model` (`qwen3.6-max-preview` / `qwen3.6-flash` / `qwen3.6-plus` / `qwen3.6-27b` / `qwen3.6-35b-a3b`) — при необходимости переключайтесь в той же кодовой базе.
  </Accordion>

  <Accordion title="В чем разница между open-weight (27b / 35b-a3b) и закрытыми уровнями?">
    Три основных отличия: **(1) Загружаемые веса** — open-weight checkpoints доступны на Hugging Face для внутреннего аудита, подачи материалов по комплаенсу или будущей миграции на локальный inference; **(2) Хостинг вычислений** — APIYI размещает open weights на своем официальном реле, так что вы просто вызываете API, без аренды GPU / развертывания / ops; **(3) Более простая тарификация** — open-weight уровни используют фиксированное ценообразование, без уровней, что упрощает планирование бюджета. По возможностям: 35B-A3B имеет общую родословную с закрытым Flash (другой уровень распределения); 27B — независимая dense-модель, чьи возможности в кодинге сопоставимы с моделями с гораздо большим числом параметров.
  </Accordion>

  <Accordion title="Если веса открыты, зачем использовать hosted API от APIYI?">
    Самостоятельный хостинг большой open-модели требует как минимум: мощных GPU (для 27B нужен минимум один A100 40G; для 35B-A3B требуется больше VRAM), фреймворка для inference (vLLM / TensorRT-LLM), мониторинга, failover и pipeline обновлений. **Официальный hosted relay от APIYI берет это на себя** — тарификация по token, масштабирование по demand и тот же совместимый с OpenAI SDK, что и у закрытых уровней. Разрабатывайте через API, а позже решите, переходить ли на self-hosting. Переход остается плавным.
  </Accordion>

  <Accordion title="Как именно работает ступенчатое ценообразование?">
    Уровень определяется по **общему числу input token одного запроса**. Все token (input + output) в этом запросе тарифицируются по ставке соответствующего уровня. Пример: запрос к Flash с 300K input token попадает в `256K – 1000K` и тарифицируется для всего запроса по \$0.68 / \$4.08 — без разделения на «первые 256K дешево, оставшиеся 44K дороже».
  </Accordion>

  <Accordion title="Max-Preview — это Preview. Он готов к production?">
    Да, но сначала запустите canary. Команда Qwen заявляла, что последующие revisions будут и дальше уточнять веса. Для критичных сценариев проведите A/B-тест на ваших benchmark-задачах и переключайте основной трафик только после выхода стабильной версии.
  </Accordion>

  <Accordion title="Как отправить мультимодальный input в Flash?">
    Используйте совместимый с Vision формат OpenAI: в `messages` передавайте `content` как массив, где каждый элемент — это `{type: "text", text: ...}` или `{type: "image_url", image_url: {url: ...}}`. Для видео следуйте полям `video_url` / frame-sampling из официальной документации.
  </Accordion>

  <Accordion title="Цены APIYI такие же, как на официальном сайте Alibaba Cloud Bailian?">
    Прайс-лист совпадает с официальным тарифом. Отличие в том, что APIYI добавляет [бонусы за пополнение](/ru/faq/recharge-promotions), и эффективная цена за unit получается примерно **85% от прайса**, плюс единый аккаунт, который поддерживает всю совместимую с OpenAI экосистему (GPT / Claude / Gemini / DeepSeek / GLM и т. д.) — не нужно поддерживать несколько аккаунтов разных вендоров.
  </Accordion>

  <Accordion title="Поддерживаются function calling / использование tools?">
    Да. Все три модели принимают стандартные для OpenAI `tools` / `tool_choice`. Вы можете переиспользовать существующую логику tool-calling из Agent-framework. Max-Preview особенно хорошо подходит для многошаговых вызовов tools и долгосрочного планирования.
  </Accordion>

  <Accordion title="Поддерживается вывод chain-of-thought?">
    Max-Preview автоматически включает CoT для задач на reasoning; у Plus CoT всегда включен; Flash ориентирован на скорость и по умолчанию не выводит CoT. Имена полей соответствуют формату ответа Alibaba Cloud (`reasoning_content` и т. д.).
  </Accordion>

  <Accordion title="Что делать, если мой запрос превышает 1M context?">
    У Flash и Plus лимит — 1M token; у Max-Preview — 262K. При превышении лимита возвращается `400`. Перед отправкой применяйте summarization / chunking / RAG retrieval — не пытайтесь отправить все одним запросом.
  </Accordion>

  <Accordion title="Могу ли я напрямую использовать официальный OpenAI SDK?">
    Да. Установите `base_url` в `https://api.apiyi.com/v1` и передайте любой из указанных выше model IDs как `model` — миграция без изменения кода.
  </Accordion>

  <Accordion title="Тарифицируются ли неудачные запросы?">
    Ошибки на стороне клиента `4xx` (ошибка параметров / сбой авторизации / блокировка moderation контента) не тарифицируются. Ошибки `5xx` на стороне сервера, при которых запрос не доходит до inference, тоже не тарифицируются. Запросы, которые успешно возвращают token, тарифицируются по фактическому числу token, даже если клиент отменил их в середине stream.
  </Accordion>
</AccordionGroup>

## Сопутствующие документы

* [Подробный разбор: запуск Qwen3.6 Max-Preview и Flash](/en/news/qwen-3-6-max-flash-launch)
* [Подробный разбор: запуск Qwen3.6-Plus — сильнейший coding agent Alibaba](/en/news/qwen-3-6-plus-launch)
* [Акции на пополнение](/ru/faq/recharge-promotions) — снизьте удельную цену примерно до 85% от прайса
* [Каталог моделей](/ru/api-capabilities/model-info) — все доступные модели и группы
* [Руководство по API](/ru/api-manual) — общие соглашения по использованию

<Info>
  **Итог**: Серия Qwen3.6 покрывает всю кривую спроса — от тяжелых coding agent'ов до высокообъемной мультимодальной маршрутизации. Max-Preview выводит отечественный coding на новый уровень; Flash резко снижает удельную цену мультимодальных задач с длинным контекстом; Plus остается надежной сбалансированной рабочей лошадкой; open-weight варианты 27B и 35B-A3B, размещенные в официальном релеe APIYI, замыкают цикл «контролируемые open weights без аренды GPU». Все пять используют один и тот же эндпоинт, совместимый с OpenAI Chat, по цене, совпадающей с официальным тарифом, и суммируются с бонусами за пополнение примерно до 85% от прайса — это лучшее на текущий момент сочетание цены и производительности в канале официального релея Aliyun.
</Info>
