Skip to main content
На этой странице описывается все, что может делать серия Grok на эндпоинте /v1/chat/completions. Все выводы основаны на практическом тестировании шлюза APIYI 13 июля 2026 года (UTC+8).

Базовый чат и потоковая передача

Все шесть моделей поддерживают стандартный формат OpenAI и потоковую передачу. stream_options: {"include_usage": true} проверен и работает (в финальном чанке передается полная информация об использовании):
Измеренное время до первого token при потоковой передаче: 1.5–2.3 s для всех моделей; короткие вопросы и ответы без потоковой передачи завершаются в целом за 1.7–5.1 s.

Цепочка рассуждений (рассуждение)

Это наиболее часто неправильно понимаемый аспект тарификации серии Grok — прочитайте этот раздел целиком.

Какие модели выдают chain-of-thought

tokens рассуждения учитываются в тарификации вывода. В одном измеренном коротком Q&A видимый ответ был всего 30 tokens, но было тарифицировано 586 output tokens (556 из них — reasoning). Для частых коротких Q&A, grok-4.20-0309-non-reasoning значительно экономит.

Просмотр chain-of-thought и использования рассуждения

Параметр reasoning_effort

reasoning_effort (например, "low" / "high") поддерживается только grok-4.5; grok-4.20-0309-reasoning явно отклоняет его с 400 Model ... does not support parameter reasoningEffort. Не жестко прописывайте этот параметр в коде для разных моделей.

Структурированные выходные данные

Стандарт OpenAI response_format: json_schema (strict mode) поддерживается. Проверено: успешно проходит на grok-4.5 / grok-4.3 / grok-build-0.1 / grok-4.20-0309-reasoning и multi-agent model — все возвращают JSON, строго соответствующий схеме:

Вызов функций

Поддерживаются стандартные для OpenAI поля tools / tool_choice и полный двухраундовый поток вызова tools (подтверждено на grok-4.5 / grok-4.3 / grok-build-0.1):
Принудительные вызовы tools через tool_choice ({"type": "function", "function": {"name": "get_weather"}}) также подтверждены как работающие.
Этот раздел посвящен client-side function calling (ваш код выполняет tool). Если вы хотите, чтобы серверы xAI искали, запускали код или подключались к MCP за вас, используйте Responses API — см. Web & X Search и Code Execution & MCP.

Вход Vision (понимание изображений)

Чат-модели Grok 4.x принимают входные изображения (jpg / png, до 20MiB на изображение) в формате OpenAI Vision. Проверено на grok-4.5 / grok-4.3 / grok-4.20-0309-non-reasoning — все корректно определили формы и цвета:
Предпочитайте base64 data URLs. При использовании внешних URL изображение извлекается напрямую вышестоящими серверами xAI — в ходе тестирования некоторые хосты изображений (например, Wikimedia) отклоняют серверные запросы на получение, и запрос завершается с image_download_error. Если вам необходимо использовать внешние URL, убедитесь, что хост разрешает серверный доступ и URL указывает непосредственно на файл изображения.

Кэширование промптов (Автоматически)

Префиксное кэширование Grok работает автоматически — без настройки. В тестировании, начиная со второго запроса с тем же префиксом, попадание в кэш составило 2688/2735 token, и тарифицировалось по сниженной ставке кэша:
Оптимизация: размещайте стабильный контент (system prompt, few-shot examples) в начале сообщений, а изменяемый контент — в конце, чтобы максимизировать попадания по префиксу. Шлюз APIYI работает в режиме key-pool, поэтому закладывайте реалистичные ожидания по частоте попаданий (100% не гарантируется); подробности тарификации — в тарификации кэша.

Часто задаваемые вопросы

Вы не можете. Внутреннее рассуждение присуще grok-4.5 / grok-4.3 / grok-build-0.1. Если вам не нужен chain-of-thought и вы хотите быстрые, недорогие ответы, используйте вместо этого grok-4.20-0309-non-reasoning.
Нет. При повторном воспроизведении истории в многоходовых беседах отправляйте обратно только content (плюс поля вызова tools). reasoning_content — это не стандартное поле: передача его обратно лишь увеличивает input tokens.
Цепочка рассуждений тоже расходует бюджет вывода. Если max_tokens слишком мал, рассуждение может съесть весь бюджет и обрезать видимый ответ. Для моделей с рассуждением начните с 2048 или выше.
Да, они принимаются обычным образом. Имейте в виду, что модели с рассуждением менее чувствительны к параметрам сэмплирования, чем традиционные модели, поэтому эффект от настройки ограничен.

Связанные документы

Обзор Grok

Линейка моделей, тарификация и матрица возможностей

Поиск в Web и X

Практика работы с инструментами live-search на стороне сервера