grok-4.6 — новейший флагман xAI, выпущенный 7 августа 2026 года. Он использует ту же V9-основу с 1.5T параметров, что и grok-4.5, а весь прирост получен за счет пост-обучения, и его цена по прайсу идентична grok-4.5; grok-4.3 и серия grok-4.20 предлагают контекстное окно 1M token; инструменты Responses API web_search / x_search / code_interpreter / MCP все подтверждённо работают на APIYI, а X search — это возможность, уникальная для Grok; нативная поддержка Responses также означает, что Grok может plug straight into OpenAI Codex. Вся серия может работать в группе GrokOfficial с коэффициентом тарифа 0.8x (скидка 20%) — см. ниже «Группы и скидки».Линейка моделей
grok-4.6
grok-4.5
grok-4.3
grok-4.20 Варианты
-reasoning и -non-reasoning имеют одинаковую цену и контекст 1M; выбирайте в зависимости от того, нужна ли вам цепочка рассуждений.grok-build-0.1
grok-4.20-multi-agent-beta-0309
Другие страницы с возможностями
Цены
Указанные цены соответствуют официальным ценам xAI (проверено построчно по APIYI pricing API на 2026-07-13;grok-4.6 повторно проверено 2026-08-13). Скидка APIYI складывается из GrokOfficial группы с коэффициентом 0.8x и акций на пополнение, при этом они суммируются.
Таблица ниже — это уровень контекста 0 – 200K (вся серия Grok тарифицируется по уровням в зависимости от длины контекста; более высокий уровень описан ниже):
Тарифы по уровням и ставки кэша
Вся серия Grok тарифицируется по двум уровням в зависимости от длины контекста одного запроса, с границей на 200K tokens (200Ki = 204,800). Выше этого порога ставки входа и выхода удваиваются:grok-4.6 и grok-4.5 — это ставка кэшированного чтения ($0.50 против $0.30) — вход и выход одинаковы.
Оба уровня grok-4.6 были проверены по пунктам в консоли APIYI для входа, выхода и кэшированного чтения; ставки кэшированного чтения второго уровня для остальных моделей получены из правила xAI «second tier doubles», поэтому считайте актуальный список на странице информации о модели источником истины.
- Псевдонимы
grok-code-fast/grok-code-fast-1также доступны для вызова (связность подтверждена); см. страницу информации о модели для их цен. - Кэшированные входные tokens тарифицируются по ставке кэшированного чтения в таблице выше. Кэширование промптов Grok выполняется автоматически — настройка не требуется, что подтверждено на обоих endpoint и как при streaming, так и без него; см. руководство по тарификации кэша Grok.
- Следите за границей уровня при работе с длинным контекстом: один запрос на 210K tokens тарифицируется целиком по второму уровню, а не только 10K выше границы. Разбиение запросов позволяет избежать скачка.
Группы и скидки
GrokOfficial имеет идентичное поведение модели и синтаксис вызова, как у группы по умолчанию. Он существует исключительно как промоакция, чтобы стимулировать большее использование в серии Grok. Выберите его при создании токена (или добавьте его к уже существующему токену Grok), и никаких изменений в коде не требуется; grok-4.6 и остальная часть серии по-прежнему доступны в Codex в этой группе.
Скидка суммируется с акциями на пополнение (10%–20%). Если брать grok-4.6 по первому уровню:
Проверенная матрица возможностей
Проверено 2026-07-13 (UTC+8) на шлюзе APIYI (✅ работает, проверено; ◐ ещё не тестировалось, ожидается идентичное поведение на той же архитектуре; — не охвачено, ожидается идентичное поведение на той же архитектуре):grok-4.6 по-прежнему содержит пометки ◐: этот прогон из 56 запросов датирован 2026-07-13, до появления 4.6. 2026-08-19 мы повторно протестировали базовый чат, потоковую передачу (с usage) и кэширование промптов на 4.6 — как в /v1/chat/completions, так и в /v1/responses, в режимах streaming и без streaming, со сверкой тарификации построчно — поэтому в этих строках теперь указаны проверенные результаты. Оставшиеся пометки ◐ переносят ожидание идентичности на той же архитектуре: 4.6 унаследовала 1.5T-параметрическую основу V9, API-протокол и эндпоинты 4.5, а xAI не объявляла о несовместимых изменениях на уровне параметров. Прогоните небольшой набор запросов на своём сценарии использования, прежде чем выводить его в production.Эндпоинты
Используйте напрямую в Codex
Поскольку Grok изначально поддерживает/v1/responses, это одна из немногих моделей не от OpenAI, которая работает в OpenAI Codex (настольное приложение / расширение IDE / CLI) по нативному протоколу responses — задайте model = "grok-4.6" и wire_api = "responses" в config.toml, и вы подключитесь за 5 минут, при этом все агентные возможности Codex (вызовы инструментов, элементы reasoning и т. д.) работают через нативный протокол. Напротив, Claude / Gemini в APIYI работают только в совместимом с OpenAI режиме chat (резервный вариант wire_api = "chat"), что приводит к несовместимости протоколов в сценариях Codex / agent. Полные шаги настройки: Руководство по интеграции с Codex.
Быстрый старт
Примечание по тарификации: токены рассуждения
grok-4.6 / grok-4.5 / grok-4.3 / grok-build-0.1 по умолчанию выполняют внутреннее рассуждение: ответы включают reasoning_content, а reasoning tokens учитываются в тарификации вывода. На коротких вопросах и ответах, чувствительных к затратам, переключитесь на grok-4.20-0309-non-reasoning. Подробности в Чат и рассуждение.
Частые вопросы
Есть ли у Grok свой собственный нативный формат API?
Есть ли у Grok свой собственный нативный формат API?
/v1/chat/completions (chat) плюс /v1/responses (Responses API и server-side tools). Укажите OpenAI SDK на https://api.apiyi.com/v1, и вы получите полный набор возможностей — никакого «downgrade в режиме совместимости» нет.Как включить web search?
Как включить web search?
tools: [{"type": "web_search"}] (или x_search). Устаревшее поле search_parameters в Chat Completions было удалено xAI (проверено 410) — не используйте его. См. Веб- и X-поиск.Модель представляется как Grok 4 — мой запрос попадает не в ту модель?
Модель представляется как Grok 4 — мой запрос попадает не в ту модель?
model в вашем запросе и в ответе, а не по самоописанию модели.Нужно ли настраивать кэширование?
Нужно ли настраивать кэширование?
usage.prompt_tokens_details.cached_tokens (на /v1/responses читайте usage.input_tokens_details.cached_tokens). Попадания округляются вниз до 128 tokens, и оба тестовых прогона согласуются с этим: префикс на 8802 token дал попадание на 8704, префикс на 2735 token — на 2688. xAI указывает, что записи кэша могут быть вытеснены, а попадания в кэш не гарантируются, поэтому закладывайте бюджет по цене без кэша. Полные подробности — в руководстве по тарификации кэша Grok.Что произойдет, если я превышу контекстное окно?
Что произойдет, если я превышу контекстное окно?
Тарифицируются ли неудачные запросы?
Тарифицируются ли неудачные запросы?
deferred: true молча игнорируется — запрос фактически выполняется синхронно и тарифицируется обычно.