Skip to main content
Grok — это флагманское семейство моделей xAI. Текущее поколение (Grok 4.x) охватывает пять продуктовых линеек — флагманскую универсальную, стандартную с длинным контекстом, варианты с рассуждением/без рассуждения, ориентированную на код и для мультиагентной совместной работы — и все они доступны на APIYI. Официальный API xAI сам по себе совместим с OpenAI (Chat Completions + Responses API) и не имеет отдельного проприетарного протокола, поэтому вызов Grok через APIYI с помощью OpenAI SDK дает вам полный набор возможностей, включая официальные серверные инструменты (web search, X search, code execution, Remote MCP). Эта группа документации основана на полном практическом тестировании шлюза APIYI 13 июля 2026 года (UTC+8) — 56 логов запросов/ответов — поэтому каждая указанная здесь граница возможностей подтверждена.
🚀 Основные моменты: grok-4.6 — новейший флагман xAI, выпущенный 7 августа 2026 года. Он использует ту же V9-основу с 1.5T параметров, что и grok-4.5, а весь прирост получен за счет пост-обучения, и его цена по прайсу идентична grok-4.5; grok-4.3 и серия grok-4.20 предлагают контекстное окно 1M token; инструменты Responses API web_search / x_search / code_interpreter / MCP все подтверждённо работают на APIYI, а X search — это возможность, уникальная для Grok; нативная поддержка Responses также означает, что Grok может plug straight into OpenAI Codex. Вся серия может работать в группе GrokOfficial с коэффициентом тарифа 0.8x (скидка 20%) — см. ниже «Группы и скидки».

Линейка моделей

grok-4.6

Новый флагман · Код и агентыВыпущен 2026/8/7, контекст 500K. Та же база и та же цена, что и у grok-4.5, с более строгой самопроверкой при длительных задачах.

grok-4.5

Предыдущий флагман · Та же ценаКонтекст 500K, предлагается по той же цене, что и grok-4.6 — существующие рабочие нагрузки могут оставаться на ней.

grok-4.3

Стандартная рабочая модельКонтекст 1M примерно за 60% от цены флагмана — сбалансированный выбор для повседневного чата и рассуждения среднего уровня.

grok-4.20 Варианты

С рассуждением / Без рассуждения-reasoning и -non-reasoning имеют одинаковую цену и контекст 1M; выбирайте в зависимости от того, нужна ли вам цепочка рассуждений.

grok-build-0.1

С акцентом на кодКонтекст 256K и самая низкая цена в серии — идеально для частого автодополнения кода и простых задач по программированию.

grok-4.20-multi-agent-beta-0309

Совместная работа нескольких агентовНесколько агентов работают параллельно над сложными исследовательскими задачами. Особый профиль тарификации — см. Многоагентная модель.

Другие страницы с возможностями

Чат/рассуждение/vision: Чат и рассуждение; поиск в реальном времени: Веб и поиск в X.

Цены

Указанные цены соответствуют официальным ценам xAI (проверено построчно по APIYI pricing API на 2026-07-13; grok-4.6 повторно проверено 2026-08-13). Скидка APIYI складывается из GrokOfficial группы с коэффициентом 0.8x и акций на пополнение, при этом они суммируются. Таблица ниже — это уровень контекста 0 – 200K (вся серия Grok тарифицируется по уровням в зависимости от длины контекста; более высокий уровень описан ниже):

Тарифы по уровням и ставки кэша

Вся серия Grok тарифицируется по двум уровням в зависимости от длины контекста одного запроса, с границей на 200K tokens (200Ki = 204,800). Выше этого порога ставки входа и выхода удваиваются: Все значения указаны за 1M tokens. Единственное различие в цене между grok-4.6 и grok-4.5 — это ставка кэшированного чтения ($0.50 против $0.30) — вход и выход одинаковы. Оба уровня grok-4.6 были проверены по пунктам в консоли APIYI для входа, выхода и кэшированного чтения; ставки кэшированного чтения второго уровня для остальных моделей получены из правила xAI «second tier doubles», поэтому считайте актуальный список на странице информации о модели источником истины.
  • Псевдонимы grok-code-fast / grok-code-fast-1 также доступны для вызова (связность подтверждена); см. страницу информации о модели для их цен.
  • Кэшированные входные tokens тарифицируются по ставке кэшированного чтения в таблице выше. Кэширование промптов Grok выполняется автоматически — настройка не требуется, что подтверждено на обоих endpoint и как при streaming, так и без него; см. руководство по тарификации кэша Grok.
  • Следите за границей уровня при работе с длинным контекстом: один запрос на 210K tokens тарифицируется целиком по второму уровню, а не только 10K выше границы. Разбиение запросов позволяет избежать скачка.

Группы и скидки

GrokOfficial имеет идентичное поведение модели и синтаксис вызова, как у группы по умолчанию. Он существует исключительно как промоакция, чтобы стимулировать большее использование в серии Grok. Выберите его при создании токена (или добавьте его к уже существующему токену Grok), и никаких изменений в коде не требуется; grok-4.6 и остальная часть серии по-прежнему доступны в Codex в этой группе. Скидка суммируется с акциями на пополнение (10%–20%). Если брать grok-4.6 по первому уровню:

Проверенная матрица возможностей

Проверено 2026-07-13 (UTC+8) на шлюзе APIYI (✅ работает, проверено; ◐ ещё не тестировалось, ожидается идентичное поведение на той же архитектуре; — не охвачено, ожидается идентичное поведение на той же архитектуре):
Почему столбец grok-4.6 по-прежнему содержит пометки ◐: этот прогон из 56 запросов датирован 2026-07-13, до появления 4.6. 2026-08-19 мы повторно протестировали базовый чат, потоковую передачу (с usage) и кэширование промптов на 4.6 — как в /v1/chat/completions, так и в /v1/responses, в режимах streaming и без streaming, со сверкой тарификации построчно — поэтому в этих строках теперь указаны проверенные результаты. Оставшиеся пометки ◐ переносят ожидание идентичности на той же архитектуре: 4.6 унаследовала 1.5T-параметрическую основу V9, API-протокол и эндпоинты 4.5, а xAI не объявляла о несовместимых изменениях на уровне параметров. Прогоните небольшой набор запросов на своём сценарии использования, прежде чем выводить его в production.

Эндпоинты

Используйте напрямую в Codex

Поскольку Grok изначально поддерживает /v1/responses, это одна из немногих моделей не от OpenAI, которая работает в OpenAI Codex (настольное приложение / расширение IDE / CLI) по нативному протоколу responses — задайте model = "grok-4.6" и wire_api = "responses" в config.toml, и вы подключитесь за 5 минут, при этом все агентные возможности Codex (вызовы инструментов, элементы reasoning и т. д.) работают через нативный протокол. Напротив, Claude / Gemini в APIYI работают только в совместимом с OpenAI режиме chat (резервный вариант wire_api = "chat"), что приводит к несовместимости протоколов в сценариях Codex / agent. Полные шаги настройки: Руководство по интеграции с Codex.
Следующее НЕ поддерживается на APIYI (подтверждено — избегайте этих ловушек):
  • Legacy Completions (/v1/completions): отклонено на стороне upstream — вся линейка Grok 4.x представляет собой reasoning-архитектуру и не поддерживает raw text completion на официальном уровне
  • Устаревший параметр live-search search_parameters: удалён xAI (подтверждён 410). Весь live search проходит через инструменты Responses API — см. Поиск в Web и X
  • Batch API / Files: не маршрутизируется через шлюз; не применимо к режиму key-pool
  • Deferred Completions (deferred: true): параметр молча игнорируется — запрос выполняется синхронно и тарифицируется как обычно. Не полагайтесь на него
  • Collections Search (RAG / file_search): требует заранее созданных collections в консоли xAI; не применимо к режиму key-pool
  • Context Compaction (/v1/responses/compact), Priority Processing (service_tier: "priority" — в тестировании откатывается к значениям по умолчанию), режим WebSocket, аутентификация mTLS: все не поддерживается

Быстрый старт

Какую модель выбрать: по умолчанию выбирайте grok-4.3 (контекстное окно 1M, сбалансированная цена); переходите на grok-4.6 для кодирующих агентов и сложных задач (новейший флагман, с той же ценой, что и у grok-4.5, так что для существующих рабочих нагрузок 4.5 достаточно лишь изменить название модели); используйте grok-4.20-0309-non-reasoning для быстрых недорогих ответов (без chain-of-thought, самый дешевый вывод); grok-build-0.1 для высокочастотного автодополнения кода; и обращайтесь к мультиагентной модели только для сложных исследовательских задач (учитывайте усиление тарификации). Для минимально эффективного тарифа переместите ваш Token в группу GrokOfficial (0.8x) и добавьте бонус за пополнение.

Примечание по тарификации: токены рассуждения

grok-4.6 / grok-4.5 / grok-4.3 / grok-build-0.1 по умолчанию выполняют внутреннее рассуждение: ответы включают reasoning_content, а reasoning tokens учитываются в тарификации вывода. На коротких вопросах и ответах, чувствительных к затратам, переключитесь на grok-4.20-0309-non-reasoning. Подробности в Чат и рассуждение.

Частые вопросы

Нет, отдельного проприетарного протокола нет. Официальный REST API xAI совместим с OpenAI: /v1/chat/completions (chat) плюс /v1/responses (Responses API и server-side tools). Укажите OpenAI SDK на https://api.apiyi.com/v1, и вы получите полный набор возможностей — никакого «downgrade в режиме совместимости» нет.
Используйте Responses API: tools: [{"type": "web_search"}] (или x_search). Устаревшее поле search_parameters в Chat Completions было удалено xAI (проверено 410) — не используйте его. См. Веб- и X-поиск.
Это нормально. Все модели Grok 4.x самоидентифицируются просто как «Grok 4» (многoагентная модель называет себя Oppie) и не сообщают точные номера версий вроде 4.6 / 4.5 / 4.3. Проверяйте идентичность по полю model в вашем запросе и в ответе, а не по самоописанию модели.
Нет. Кэширование префикса Grok выполняется автоматически; проверяйте попадания в кэш через usage.prompt_tokens_details.cached_tokens (на /v1/responses читайте usage.input_tokens_details.cached_tokens). Попадания округляются вниз до 128 tokens, и оба тестовых прогона согласуются с этим: префикс на 8802 token дал попадание на 8704, префикс на 2735 token — на 2688. xAI указывает, что записи кэша могут быть вытеснены, а попадания в кэш не гарантируются, поэтому закладывайте бюджет по цене без кэша. Полные подробности — в руководстве по тарификации кэша Grok.
Ошибка 400. Лимиты различаются в зависимости от модели: grok-4.6 и grok-4.5 — 500K, grok-4.3 и серия 4.20 — 1M, grok-build-0.1 — 256K. Для более длинного содержимого суммируйте, разбивайте на части или используйте RAG retrieval.
Ошибки клиента 4xx (неверные параметры / сбои авторизации) не тарифицируются; запросы, которые успешно возвращают tokens, тарифицируются по фактическому использованию. Обратите внимание, что deferred: true молча игнорируется — запрос фактически выполняется синхронно и тарифицируется обычно.

Связанные документы

Чат и Reasoning

Streaming, chain-of-thought, структурированные результаты, вызов функций, vision, кэширование

Тарификация кэша

Скидка 75% на попадания в кэш, блочная гранулярность 128 token и какой эндпоинт подходит для длинных диалогов

Веб и поиск X

Практическая работа с инструментами web_search / x_search в Responses API

Выполнение кода и MCP

Песочница Python на стороне сервера и интеграция Remote MCP

Мультиагентная модель

Возможности и профиль тарификации мультиагентной модели

Используйте Grok в Codex

Нативный responses protocol, подключение к Codex за 5 минут

Подробный разбор запуска Grok 4.6

Бенчмарки, цены и заметки по миграции для новейшего флагмана xAI

Подробный разбор запуска Grok 4.5

Подробный обзор предыдущего флагмана

Информация о моделях

Все доступные модели и группы