Skip to main content
APIYI поддерживает более 400 основных моделей AI. На этой странице приведены подробные сведения о моделях, ценах и инструкции по использованию.
API-центр профессионального уровня для крупных AI-моделей, отличающийся корпоративной надежностью и стабильностью Все модели поступают из официальных источников и проходят релей, при этом цены на ~20% ниже (за счет сочетания бонусов за пополнение и преимуществ обменного курса), объединяя различные отличные крупные модели. Без ограничений скорости, без риска блокировки аккаунта, тарификация по факту использования, долгосрочно надежный сервис.

🔥 Рекомендуемые модели на данный момент

Ниже перечислены популярные модели, которые в настоящее время стабильно доступны. Для полного списка моделей и актуальных цен посетите страницу цен в консоли APIYI или раздел обзора цен на модели на сайте.
Рекомендации по обновлению модели: Мы рекомендуем использовать последние модели для наилучшей производительности, но обратите внимание:
  1. Начальная нестабильность — это нормально: недавно выпущенные модели могут отвечать медленно, завершаться по тайм-ауту или иногда выдавать ошибки из-за ограниченной вычислительной мощности у поставщика — обычно это стабилизируется в течение нескольких дней или недель
  2. Проверьте совместимость параметров: новые модели могут добавлять или изменять параметры (например, max_completion_tokens, заменяющий max_tokens). Перед обновлением убедитесь, что ваши параметры API по-прежнему совместимы со старыми моделями
  3. Всегда тестируйте перед запуском в продакшн: перед развертыванием новой модели в production тщательно проверьте ее в тестовой среде, чтобы убедиться, что качество вывода и совместимость API соответствуют ожиданиям
«—» в столбце context означает, что поставщик не опубликовал окончательное значение; сверяйтесь с консолью и официальной документацией. Все цены указаны как розничные цены за 1M tokens и могут комбинироваться с бонусами за пополнение.

Категории моделей

🤖 Серия OpenAI

🆕 Новейшие модели

Предоставление GPT-5.6 в двух группах: группы официального релея по умолчанию (default / svip) используют официальные цены, с бонусом к пополнению до 20% (около 83% от прайс-листа). Для группы CodexReverse по умолчанию действует скидка 0.7, поэтому она лучше подходит для пакетных рабочих нагрузок с ограниченным бюджетом. В существующем коде GPT-5.5 достаточно заменить поле model. См. примечания к запуску GPT-5.6.
Примечания по использованию серии GPT Pro (например, gpt-5.5-pro, gpt-5.4-pro):
  1. Только эндпоинт /v1/responses: нельзя использовать /v1/chat/completions — перед вызовом переключите SDK / код на API ответов
  2. Очень высокая стоимость: один вызов может стоить несколько долларов; модель доступна только группе SVIP, чтобы предотвратить случайное использование в группе Default
  3. Не рекомендуется для непрофессиональных задач: для повседневных задач используйте GPT-5.6 Sol / Terra; Pro подходит только для исследований и задач высшего уровня, требующих исключительной глубины рассуждения

✅ Стабильные / классические

Примечания по использованию GPT-5 и более новых серий:
  1. Параметр temperature temperature должен быть равен 1 (поддерживается только значение 1)
  2. Используйте max_completion_tokens вместо max_tokens
  3. Не передавайте параметр top_p
Модели для генерации изображений и видео перенесены на отдельную страницу. Полный список и цены см. на странице Модели для генерации изображений и видео.

🎭 Серия Claude (Anthropic)

🆕 Последние модели

Соответствие требованиям по 30-дневному хранению данных для Fable 5 / Mythos 5: из-за расширенных возможностей этих моделей Bedrock и Anthropic проводят дополнительные проверки на предмет злоупотреблений с высоким риском. Для этих двух моделей входные данные и выходные данные хранятся 30 дней, чтобы выявлять серьезные злоупотребления — по умолчанию доступ к ним получают автоматизированные системы безопасности, а участие человека требуется только при наличии признаков потенциального вреда. Хранение происходит на стороне AWS / Anthropic; APIYI — это чистый прозрачный прокси и ничего не хранит у себя. Остальные модели Claude это не затрагивает. См. примечания к запуску Fable 5.

✅ Стабильные / классические

Последние: Claude Opus 5 приближается к уровню интеллекта Fable 5 за половину цены ($5/$25, как у Opus 4.8) — безболезненное обновление. Sonnet 5 позиционируется как самый agentic Sonnet на сегодня, близок к Opus 4.8, но быстрее и дешевле. Стабильные: Opus 4.7 и Sonnet 4.6 уже проверены в бою для производственных рабочих процессов; Haiku 4.5 предлагает скорость x2 и отличную ценность.

🌟 Серия Google Gemini

🆕 Последние модели

Примечание: Gemini 3 Pro Preview был снят с поддержки 9 марта 2026 года. Пожалуйста, перейдите на Gemini 3.1 Pro Preview или Gemini 3.6 Flash.

✅ Стабильные / Классические

Новое: Gemini 3.6 Flash и 3.5 Flash-Lite были проверены end-to-end более чем по 30 тестовым случаям каждый как в нативном формате Gemini, так и в формате, совместимом с OpenAI, при этом были включены все native tools. Перед интеграцией ознакомьтесь с обзором 3.6 Flash и обзором 3.5 Flash-Lite. Стабильное: Gemini 2.5 Pro (контекст 2M) и Gemini 2.5 Flash подходят для устоявшихся production-сред.

🚀 Серия xAI Grok

🆕 Новейшие модели

✅ Стабильные / классические

Эффективность token у Grok 4.5: в SWE Bench Pro в среднем использует всего 15,954 выходных token, примерно 1/4.2 от Opus 4.8 (max), вдвое сокращая число шагов задачи и реальные затраты на ту же работу. Обратите внимание, что запросы свыше 200K token тарифицируются по более высокой ставке за длинный контекст у поставщика.

🔍 Серия DeepSeek

🐘 Китайская серия моделей

Zhipu AI (GLM)

🆕 Новейшее: GLM-5.2 | ✅ Стабильные / Классические: GLM-5.1, GLM-5, GLM-4.6
Возможности GLM-5.2:
  • Контекст увеличен с 200K у GLM-5.1 до 1M token — загружайте целые проекты и несколько длинных документов одновременно
  • 744B MoE, Terminal-Bench 2.1 81.0 / SWE-bench Pro 62.1, лидирующая open-source-модель для кодирования с длинным горизонтом
  • Прямой официальный релей Alibaba Cloud с тарификацией, привязанной к вендору (пересчет по фиксированному курсу 1:7); ~85% от прайса с бонусами за пополнение
  • Для длительных задач увеличьте timeout выше 600 секунд. См. примечания к запуску GLM-5.2

Alibaba Qwen

🆕 Новейшее: Qwen3.7-Max | ✅ Стабильные / Классические: серия Qwen3.6, Qwen Max / Plus / Turbo

Moonshot Kimi Series

🆕 Новейшее: Kimi K3 | ✅ Стабильные / Классические: Kimi K2.6, K2.5, K2
Примечания по использованию Kimi K3:
  • Точно 1,048,576 token контекста с фиксированной тарификацией на всем диапазоне — загружайте целые репозитории или длинные документы, не беспокоясь о скачках по уровням
  • Max output по умолчанию равен 131,072 и может быть увеличен до 1,048,576 token; thinking работает на полной мощности, поэтому планируйте output tokens соответственно
  • Автоматическое кэширование контекста тарифицирует cached input по $0.30/1M (1/10 от тарифа без кэша), что особенно выгодно для многоходовых разговоров

ByteDance Seed Series

🆕 Новейшее: Seed 2.1 Turbo | ✅ Стабильные / Классические: Seed 2.0 Pro / Lite / Mini
Seed 2.1 Turbo по умолчанию включает глубокое thinking: если не задано ни одного параметра, даже однострочный вопрос сначала выдает сотни thinking token (одно предложение самопрезентации заняло 444 output tokens, из них 409 thinking), а thinking тарифицируется как обычные output tokens. Для коротких Q&A с высокой частотой запросов сделайте thinking: {"type": "disabled"} своей базовой настройкой. См. руководство по интеграции.

🌐 Серия MiniMax

🆕 Последняя: MiniMax-M3 | ✅ Стабильная / Классическая: MiniMax-M2.7, M2.5
Примечания по тарификации MiniMax-M3:
  • Многоуровневая тарификация: $0.30 за input / $1.20 за output на 1M tokens для диапазона 0-512K; все, что выше, тарифицируется по более высокому уровню
  • Имена моделей чувствительны к регистру: MiniMax-M3 (как и родственные, например MiniMax-M2.7-highspeed)
  • Оценивайте стоимость перед запуском задач с миллионным контекстом

💰 Информация о тарификации

Методы тарификации

  • Оплата по факту использования: Списывается на основе фактического использования token
  • Без минимальной платы: Платите только за то, чем пользуетесь
  • Срок действия баланса: Действует 365 дней с даты пополнения, автоматически сбрасывается при следующем пополнении (см. Акции на пополнение)
  • Списание в реальном времени: Плата списывается с баланса сразу после каждого вызова

Преимущества тарификации

  • Переадресация через официальный источник с небольшими ценовыми преимуществами
  • Для пользователей с большими объёмами можно обратиться в службу поддержки за более выгодной ценой
  • Новые аккаунты получают $0.05 пробного кредита — этого достаточно, чтобы проверить, что ваша интеграция работает

Посмотреть актуальные цены в реальном времени

Посетите страницу цен в консоли APIYI, чтобы узнать последние цены на все модели, или обзор цен на модели на сайте.

🛠️ Рекомендации по использованию

Руководство по выбору моделей

Разработка программного обеспечения
  • Максимальная производительность: Claude Opus 5 (интеллект на уровне Fable 5 почти вдвое дешевле), GPT-5.6 Sol (88,8% в Terminal-Bench 2.1), Claude Sonnet 5 (85,2% в SWE-bench), Kimi K3
  • Высокое соотношение цены и производительности: GPT-5.6 Terra (производительность уровня GPT-5.5 за половину цены), Gemini 3.6 Flash, GLM-5.2, MiniMax-M3, DeepSeek V4 Flash
  • Альтернативы: Grok 4.5, Qwen3.7-Max, Kimi K2.6, Gemini 3.5 Flash
Создание текста
  • Лучший выбор: GPT-5.6 Sol / Terra, Claude Opus 5, Claude Sonnet 5, Gemini 3.6 Flash
  • Альтернативы: chat-latest, Claude Sonnet 4.6, GLM-5.2, GPT-4.1
Быстрые ответы
  • Лучший выбор: Gemini 3.5 Flash-Lite (по умолчанию рассуждение отключено, около 2 с), Claude Haiku 4.5 (в 2 раза быстрее), GPT-5.6 Luna
  • Альтернативы: Gemini 3.1 Flash Lite, Gemini 2.5 Flash, Seed 2.1 Turbo (рассуждение необходимо явно отключить)
Обработка длинного текста
  • Сверхдлинный контекст: Gemini 2.5 Pro (2 млн), Kimi K3 (1 млн, фиксированная тарификация), MiniMax-M3 (1 млн), GLM-5.2 (1 млн), Claude Opus 5 (1 млн)
  • Примечание: некоторые модели переходят на более высокий тарифный уровень после определённого порога (Grok 4.5 — после 200 тыс., MiniMax-M3 — после 512 тыс.) — оцените затраты перед запуском длительных задач
Генерация изображений
  • Последние рекомендации: gpt-image-2.5-flare / gpt-image-2.5-sunburst (доступны с сентября 2026 года, нативное 4K, точное управление размером и качеством, та же цена, что у gpt-image-2, более быстрое / более точное редактирование соответственно), Nano Banana Pro (4K HD, лучшее отображение текста)
  • Высокое соотношение цены и производительности: Nano Banana 2 ($0.055 за изображение, от $0.025 при оплате по факту использования), Nano Banana Lite (около 4 с на изображение, $0.025 за изображение)
  • Профессиональный дизайн: Seedream 5.0 Pro ($0.12 за вызов, интерактивное редактирование и до 10 эталонных изображений), Seedream 5.0 Lite ($0.035 за изображение)
  • Самый дешёвый вариант: gpt-image-2-all (обратный канал, $0.03 за изображение)
Генерация видео
  • Первый выбор среди официальных релеев: VEO 3.1 Official ($0.3 / $1.2 за вызов, 4/6/8 с, нативное синхронизированное аудио)
  • Рабочие модели китайских поставщиков: серии Seedance 2.5 и 2.0 (2.5 / стандартная / быстрая / mini), Wan2.7, HappyHorse 1.1
  • Примечание: каналы Sora 2 были выведены из эксплуатации — используйте варианты выше. См. Модели генерации изображений и видео
Веб-поиск
  • Нативный доступ к веб-содержимому: Grok 4 All, Grok 3 All (вызов tools не требуется)
  • Поиск с привязкой к источникам: Gemini 3.6 Flash / 3.5 Flash-Lite (нативные tools включены)

Рекомендации по оптимизации затрат

  1. Многоуровневое использование: используйте более дешёвые модели для простых задач, а продвинутые модели — для сложных задач
  2. Оптимизация тестирования: сначала тестируйте на небольших моделях, а крупные модели используйте после определения требований
  3. Пакетная обработка: выбирайте уровни Luna / Lite / Mini для больших объёмов однотипных задач
  4. Повторное использование кэша: используйте контекстный кэш каждого поставщика (Kimi K3, Seed 2.1 Turbo и серия Claude тарифицируют кэшированный ввод всего от 1/10 стоимости)
  5. Отключайте ненужное рассуждение: некоторые модели рассуждают по умолчанию (Seed 2.1 Turbo, Gemini 3.6 Flash) — отключение этой функции для коротких часто задаваемых вопросов экономит и средства, и время

🔗 Связанные ресурсы

Список моделей постоянно обновляется. Мы оперативно добавим недавно выпущенные отличные модели. Чтобы узнавать о последних релизах, следите за Журналом изменений. Если у вас есть конкретные потребности по моделям или крупные объемы, пожалуйста, свяжитесь со службой поддержки.