Skip to main content
本文覆蓋 Grok 系列在 /v1/chat/completions 端點上的全部對話類能力,所有結論基於 2026年7月13日 (UTC+8) 在 API易 閘道的實測。

基礎對話與流式輸出

全系 6 個模型均支援標準 OpenAI 格式與流式輸出,stream_options: {"include_usage": true} 實測可用(末尾 chunk 返回完整 usage):
實測流式首 token 延遲 1.5–2.3 秒(全模型),非流式短問答整體延遲 1.7–5.1 秒。

思維鏈(Reasoning)

這是 Grok 系列最容易被誤解的計費點,務必讀完本節。

哪些模型輸出思維鏈

推理 tokens 計入輸出計費。實測一條短問答:可見回答僅 30 tokens,實際計費輸出 586 tokens(其中推理 556 tokens)。高頻短問答場景選 grok-4.20-0309-non-reasoning 可顯著省成本。

讀取思維鏈與推理用量

reasoning_effort 引數

reasoning_effort(如 "low" / "high"grok-4.5 接受grok-4.20-0309-reasoning 會明確報錯 Model ... does not support parameter reasoningEffort(400)。跨模型程式碼請勿硬編碼該引數。

結構化輸出(Structured Outputs)

支援 OpenAI 標準的 response_format: json_schema(strict 模式),實測 grok-4.5 / grok-4.3 / grok-build-0.1 / grok-4.20-0309-reasoning / multi-agent 模型全部通過,返回嚴格符合 schema 的 JSON:

函式呼叫(Function Calling)

支援 OpenAI 標準的 tools / tool_choice 欄位與完整的兩輪工具呼叫流程(實測 grok-4.5 / grok-4.3 / grok-build-0.1 通過):
tool_choice 強制呼叫({"type": "function", "function": {"name": "get_weather"}})實測同樣可用。
這裡說的是客戶端函式呼叫(工具由你的程式碼執行)。如果想讓 xAI 服務端替你執行搜尋 / 跑程式碼 / 連 MCP,請走 Responses API,見 聯網搜尋與 X 搜尋程式碼執行與 MCP

視覺輸入(圖片理解)

Grok 4.x 對話模型支援圖片輸入(jpg / png,單圖不大於 20MiB),使用 OpenAI Vision 相容格式。實測 grok-4.5 / grok-4.3 / grok-4.20-0309-non-reasoning 均正確識別圖形與顏色:
優先使用 base64 data URL。傳外鏈 URL 時,圖片由 xAI 上游伺服器直接抓取——實測部分圖床(如維基媒體)會對伺服器抓取返回錯誤,導致請求失敗(image_download_error)。若必須用外鏈,請確保圖床對服務端請求開放且 URL 直接指向圖片檔案。

Prompt Caching(自動快取)

Grok 字首快取自動生效,無需任何配置。同字首請求實測第二次起命中 2688/2735 tokens,命中部分按緩存摺扣價計費:
最佳化建議:把穩定不變的 system prompt / few-shot 示例放在訊息最前面,可變內容放最後,最大化字首命中。API易 閘道為號池模式,快取命中率請做合理預期(不承諾 100% 命中),計費口徑詳見 快取計費說明

常見問題

關不掉。grok-4.5 / grok-4.3 / grok-build-0.1 的內部推理是模型固有行為。若不需要思維鏈、追求快答低成本,直接改用 grok-4.20-0309-non-reasoning
多輪對話回傳歷史時,只需回傳 content(和工具呼叫相關欄位),不要把 reasoning_content 塞回 messages——它不是標準欄位,回傳徒增輸入 tokens。
推理模型的思維鏈也消耗輸出配額,max_tokens 給小了會導致思維鏈吃滿配額、正文被截斷。帶推理的模型建議 max_tokens 至少 2048 起步。
可以正常傳入。注意推理類模型對取樣引數的敏感度低於傳統模型,調優價值有限。

相關文件

Grok 概覽

模型陣容、定價與能力矩陣

聯網搜尋與 X 搜尋

server-side 聯網工具實戰