/v1/chat/completions. Все выводы основаны на практическом тестировании шлюза APIYI 13 июля 2026 года (UTC+8).
Базовый чат и потоковая передача
Все шесть моделей поддерживают стандартный формат OpenAI и потоковую передачу.stream_options: {"include_usage": true} проверен и работает (в финальном чанке передается полная информация об использовании):
Цепочка рассуждений (рассуждение)
Это наиболее часто неправильно понимаемый аспект тарификации серии Grok — прочитайте этот раздел целиком.Какие модели выдают chain-of-thought
Просмотр chain-of-thought и использования рассуждения
Параметр reasoning_effort
reasoning_effort (например, "low" / "high") поддерживается только grok-4.5; grok-4.20-0309-reasoning явно отклоняет его с 400 Model ... does not support parameter reasoningEffort. Не жестко прописывайте этот параметр в коде для разных моделей.
Структурированные выходные данные
Стандарт OpenAIresponse_format: json_schema (strict mode) поддерживается. Проверено: успешно проходит на grok-4.5 / grok-4.3 / grok-build-0.1 / grok-4.20-0309-reasoning и multi-agent model — все возвращают JSON, строго соответствующий схеме:
Вызов функций
Поддерживаются стандартные для OpenAI поляtools / tool_choice и полный двухраундовый поток вызова tools (подтверждено на grok-4.5 / grok-4.3 / grok-build-0.1):
tool_choice ({"type": "function", "function": {"name": "get_weather"}}) также подтверждены как работающие.
Вход Vision (понимание изображений)
Чат-модели Grok 4.x принимают входные изображения (jpg / png, до 20MiB на изображение) в формате OpenAI Vision. Проверено наgrok-4.5 / grok-4.3 / grok-4.20-0309-non-reasoning — все корректно определили формы и цвета:
Кэширование промптов (Автоматически)
Префиксное кэширование Grok работает автоматически — без настройки. В тестировании, начиная со второго запроса с тем же префиксом, попадание в кэш составило 2688/2735 token, и тарифицировалось по сниженной ставке кэша:Часто задаваемые вопросы
Как отключить chain-of-thought у grok-4.5?
Как отключить chain-of-thought у grok-4.5?
Вы не можете. Внутреннее рассуждение присуще
grok-4.5 / grok-4.3 / grok-build-0.1. Если вам не нужен chain-of-thought и вы хотите быстрые, недорогие ответы, используйте вместо этого grok-4.20-0309-non-reasoning.Должен ли reasoning_content возвращаться в контекст следующего хода?
Должен ли reasoning_content возвращаться в контекст следующего хода?
Нет. При повторном воспроизведении истории в многоходовых беседах отправляйте обратно только
content (плюс поля вызова tools). reasoning_content — это не стандартное поле: передача его обратно лишь увеличивает input tokens.Как следует задавать max_tokens?
Как следует задавать max_tokens?
Цепочка рассуждений тоже расходует бюджет вывода. Если
max_tokens слишком мал, рассуждение может съесть весь бюджет и обрезать видимый ответ. Для моделей с рассуждением начните с 2048 или выше.Работают ли temperature / top_p?
Работают ли temperature / top_p?
Да, они принимаются обычным образом. Имейте в виду, что модели с рассуждением менее чувствительны к параметрам сэмплирования, чем традиционные модели, поэтому эффект от настройки ограничен.
Связанные документы
Обзор Grok
Линейка моделей, тарификация и матрица возможностей
Поиск в Web и X
Практика работы с инструментами live-search на стороне сервера