Серия xAI Grok 4.x (grok-4.5 / grok-4.3 / grok-4.20 / grok-build-0.1) на APIYI: совместимый с OpenAI шлюз + два эндпоинта Responses API, с web search / X search / code execution / MCP tools на стороне сервера, подтвержденно работающими. Указанные цены соответствуют официальным ценам xAI.
Grok — флагманское семейство моделей xAI. Текущее поколение (Grok 4.x) охватывает пять продуктовых линеек — флагманскую универсальную, стандартную с длинным контекстом, варианты с рассуждением/без рассуждения, ориентированную на код и для совместной работы нескольких агентов — и все они доступны на APIYI. Официальный API xAI сам по себе совместим с OpenAI (Chat Completions + Responses API) без отдельного проприетарного протокола, поэтому вызов Grok через APIYI с помощью OpenAI SDK дает вам полный набор возможностей, включая официальные серверные инструменты (веб-поиск, X search, выполнение кода, Remote MCP).Эта группа документации основана на полном практическом тесте шлюза APIYI от 13 июля 2026 года (UTC+8) — 56 журналов запросов/ответов — поэтому каждая указанная здесь граница возможностей проверена.
🚀 Основные моменты: grok-4.5 — новейший флагман xAI, выпущенный 8 июля 2026 года (дата отсечения знаний — февраль 2026 года), созданный для кодирования и агентных задач; grok-4.3 и серия grok-4.20 предлагают контекстное окно 1M-token; инструменты Responses API web_search / x_search / code_interpreter / MCP все подтверждены как работающие в APIYI, а X search — это возможность, уникальная для Grok; родная поддержка responses также означает, что Grok можно непосредственно подключить к OpenAI Codex.
Флагман · Код и общие задачиСамая интеллектуальная модель xAI, контекстное окно 500K, создана для программирования, агентных задач и интеллектуальной работы.
grok-4.3
Стандартная рабочая лошадкаКонтекстное окно 1M примерно за 60% от цены флагмана — сбалансированный выбор для повседневного чата и рассуждения среднего уровня.
grok-4.20 Variants
С рассуждением / без рассуждения-reasoning и -non-reasoning имеют одинаковую цену и контекстное окно 1M; выбирайте в зависимости от того, нужна ли вам цепочка рассуждений.
grok-build-0.1
С фокусом на кодКонтекстное окно 256K и самая низкая цена в серии — идеально для частого автодополнения кода и простых задач программирования.
grok-4.20-multi-agent-beta-0309
Мультиагентное сотрудничествоНесколько агентов работают параллельно над сложными исследовательскими задачами. Особый профиль тарификации — см. Multi-Agent Model.
Указанные цены соответствуют официальной тарификации xAI (проверено по пунктам по API тарификации APIYI на 2026-07-13). Скидка APIYI формируется за счет акций на пополнение.
ID модели
Контекст
Вход
Выход
Позиционирование
grok-4.5
500K
$2.00 / 1M tokens
$6.00 / 1M tokens
Флагман: код / агенты / общее назначение
grok-4.3
1M
$1.25 / 1M tokens
$2.50 / 1M tokens
Основная рабочая модель
grok-4.20-0309-reasoning
1M
$1.25 / 1M tokens
$2.50 / 1M tokens
Вариант с рассуждением
grok-4.20-0309-non-reasoning
1M
$1.25 / 1M tokens
$2.50 / 1M tokens
Без рассуждения (быстрая, недорогая)
grok-4.20-multi-agent-beta-0309
1M
$1.25 / 1M tokens
$2.50 / 1M tokens
Мультиагентный вариант (усиление тарификации!)
grok-build-0.1
256K
$1.00 / 1M tokens
$2.00 / 1M tokens
Ориентирован на код
Алиасы grok-code-fast / grok-code-fast-1 тоже доступны для вызова (подключение подтверждено); их цены см. на странице информации о модели.
Кэшированные входные tokens тарифицируются по сниженной ставке. Кэширование префикса Grok автоматическое — настройка не требуется; см. тарификацию кэша.
Указанные цены соответствуют официальной тарификации xAI; сочетайте акции на пополнение, чтобы снизить фактическую стоимость.
Поскольку Grok нативно поддерживает /v1/responses, это одна из немногих не-OpenAI моделей, которые работают в OpenAI Codex (десктопное приложение / расширение IDE / CLI) через нативный протокол responses — задайте model = "grok-4.5" и wire_api = "responses" в config.toml, и вы подключитесь за 5 минут; при этом все agent features Codex (tool calls, reasoning items и т. д.) будут работать на нативном протоколе. В отличие от этого, Claude / Gemini в APIYI работают только в OpenAI-совместимом chat mode (резервный режим wire_api = "chat"), что приводит к несовместимостям протокола в сценариях Codex / agent. Полные шаги настройки: Codex Integration Guide.
Следующее НЕ поддерживается в APIYI (проверено — избегайте этих подводных камней):
Legacy Completions (/v1/completions): отклоняется upstream — вся линейка Grok 4.x является архитектурой reasoning и на официальном уровне не поддерживает raw text completion
Legacy live-search параметр search_parameters: удален xAI (подтверждено 410). Весь live search проходит через инструменты Responses API — см. Web & X Search
Batch API / Files: не маршрутизируется шлюзом; не применимо к режиму key-pool
Deferred Completions (deferred: true): параметр молча игнорируется — запрос выполняется синхронно и тарифицируется как обычно. Не полагайтесь на него
Collections Search (RAG / file_search): требует заранее созданных collections в консоли xAI; не применимо к режиму key-pool
Context Compaction (/v1/responses/compact), Priority Processing (service_tier: "priority" — в тестировании откатывается к значению по умолчанию), режим WebSocket, аутентификация mTLS: все не поддерживается
curl -X POST "https://api.apiyi.com/v1/chat/completions" \ -H "Authorization: Bearer sk-your-api-key" \ -H "Content-Type: application/json" \ -d '{ "model": "grok-4.5", "messages": [ {"role": "user", "content": "Introduce yourself in one sentence"} ] }'
from openai import OpenAIclient = OpenAI( api_key="sk-your-api-key", base_url="https://api.apiyi.com/v1")resp = client.chat.completions.create( model="grok-4.5", messages=[{"role": "user", "content": "Introduce yourself in one sentence"}])print(resp.choices[0].message.content)
import OpenAI from 'openai';const client = new OpenAI({ apiKey: 'sk-your-api-key', baseURL: 'https://api.apiyi.com/v1',});const resp = await client.chat.completions.create({ model: 'grok-4.5', messages: [{ role: 'user', content: 'Introduce yourself in one sentence' }],});console.log(resp.choices[0].message.content);
Какую модель выбрать: по умолчанию используйте grok-4.3 (1M контекст, сбалансированная цена); перейдите на grok-4.5 для coding agents и сложных задач; используйте grok-4.20-0309-non-reasoning для быстрых, недорогих ответов (без chain-of-thought, самый дешевый output); grok-build-0.1 для высокочастотного code completion; и используйте multi-agent модель только для сложных research-задач (учитывайте ее усиление тарификации).
grok-4.5 / grok-4.3 / grok-build-0.1по умолчанию выполняют внутреннее рассуждение: ответы включают reasoning_content, а tokens рассуждения учитываются в тарификации вывода. В тестах короткий ответ показал всего 30 видимых tokens, но был тарифицирован как 586 output tokens (556 из них — tokens рассуждения). Для коротких вопросов и ответов, чувствительных к стоимости, переключитесь на grok-4.20-0309-non-reasoning. Подробности в Чат и рассуждение.
Нет отдельного проприетарного протокола. Официальный REST API xAI совместим с OpenAI: /v1/chat/completions (чат) плюс /v1/responses (Responses API и tools на стороне сервера). Укажите в OpenAI SDK https://api.apiyi.com/v1, и вы получите полный набор возможностей — никакого «понижения до режима совместимости» нет.
Как включить веб-поиск?
Используйте Responses API: tools: [{"type": "web_search"}] (или x_search). Устаревшее поле search_parameters в Chat Completions было удалено xAI (подтверждено 410) — не используйте его. См. Поиск в Web и X.
Модель представляется как Grok 4 — мой запрос попадает не в ту модель?
Это нормально. Все модели Grok 4.x идентифицируют себя просто как «Grok 4» (мультиагентная модель называет себя Oppie) и не сообщают точные номера версий вроде 4.5 / 4.3. Проверяйте модель по полю model в вашем запросе и в ответе, а не по самопредставлению модели.
Нужно ли настраивать кэширование?
Нет. Кэширование префикса Grok автоматическое; проверяйте попадания в кэш через usage.prompt_tokens_details.cached_tokens (в тестировании второй запрос с тем же префиксом дал попадание в кэш на 2688/2735 tokens). Шлюз работает в режиме key-pool, поэтому корректно оценивайте ожидаемую частоту попаданий — см. тарификация кэша.
Что произойдет, если я превышу контекстное окно?
Ошибка 400. Лимиты зависят от модели: grok-4.5 — 500K, grok-4.3 и серия 4.20 — 1M, grok-build-0.1 — 256K. Для более длинного контента сокращайте, разбивайте на части или используйте извлечение RAG.
Тарифицируются ли неудачные запросы?
Ошибки клиента 4xx (неверные параметры / ошибки авторизации) не тарифицируются; запросы, которые успешно возвращают tokens, тарифицируются по фактическому использованию. Обратите внимание, что deferred: true молча игнорируется — запрос на самом деле выполняется синхронно и тарифицируется как обычно.