本頁聚焦
/v1/chat/completions 相容模式。Claude 原生格式的思考塊(/v1/messages 的 thinking)見 Claude Effort 思考指南;Gemini 原生的 thinking_level 與 thought_signature 見 Gemini 原生呼叫。推理模型輸出總覽
相容模式下,推理模型在「是否輸出思考文本」上分三類:思考型:reasoning_content
會輸出思考文本的模型,把思考鏈放在與content 平行的 reasoning_content 欄位。
非流式——message 同時含兩者:
delta.reasoning_content,思考完才開始推送 delta.content。務必把兩者分流渲染(思考摺疊、正文上屏),否則介面會先刷一大段思考:
推理 token 可能遠超正文。實測一個「1+1」級問題,grok-4.3 的
reasoning_tokens 可達數百,而正文只有幾個 token。思考鏈按輸出 token 計費,對延遲和成本敏感的場景請評估是否需要開啟 / 展示思考。思考簽名與多輪對話
「思考簽名」(thought signature)是 Gemini 原生格式的概念:原生多模態 / 函式呼叫裡,模型會返回加密的thought_signature,多輪時需原樣回傳以保持推理連續性(詳見 Gemini 原生呼叫 與 Gemini 函式呼叫)。
在 /v1/chat/completions 相容模式下,推理模型是無狀態的:
- 多輪對話只需把上一輪 assistant 的
content放進 messages 歷史即可; - 無需回傳
reasoning_content,響應裡也不出現任何 signature 欄位; - 實測 gemini-3.1-flash-lite、grok-4.3 在僅回傳
content的情況下,多輪上下文記憶均正常。
結構化輸出
通過response_format 讓模型只吐 JSON。兩種型別:
各模型實測支援度
json_schema 各家支援參差,這是結構化輸出最大的坑:
跨模型穩定拿 JSON 的建議
相關連結
- 同組頁面:響應資料處理 · 相容模式呼叫 · 函式呼叫
- 原生格式思考:Claude Effort 思考指南 · Gemini 原生呼叫
- 模型與價格:模型與價格總覽