Skip to main content
POST
Responses:DeepSeek V4 Flash 文本生成(支持显式缓存链式调用)
右側 Playground 可直接除錯:在 AuthorizationBearer sk-your-api-key。 預設示例已帶 caching: {"type": "enabled"}store: true,是顯式快取鏈式呼叫的首輪寫入形態。
Responses 端相比 Chat Completions 多一層顯式快取。模型能力、定價、思考控制詳見 DeepSeek V4 Flash 概覽
  • text.format 的 json_schema 不生效:返回 200 但完全無視 schema,3/3 次被程式碼圍欄包裹導致解析失敗
  • web_search 後端不可用:工具已接通(能看到 web_search_callstatus: completed),但 6/6 次搜尋報錯、不返回 results
  • mcp 返回 AccessDenied:賬號 / 渠道級內建工具權限問題,換合法 server 地址結果相同
  • 純文本模型,傳圖片會報 Model do not support image input

引數說明速查

顯式快取:必須走鏈式呼叫

常見誤用:把同一段長字首重複發兩次並帶上 cachingcached_tokens 會一直是 0。 顯式快取不是按字首匹配的,必須用 previous_response_id 把會話鏈起來。
正確姿勢:首輪傳完整長文寫入快取,後續輪只傳新問題並鏈上一輪的 id 每一輪把上一輪的全部上下文整體命中。做長文件連續追問時,這個模式比每輪重發全文省得多。

鏈式呼叫示例

隱式快取

不傳 caching 時隱式快取同樣生效,相同長字首重複請求命中 99.9%(15,633 → 15,616)。 兩種快取可按場景選擇:同一份字首被很多獨立請求複用走隱式快取, 同一個會話連續多輪追問走顯式快取鏈式呼叫。

輸出項型別

響應的 output 是陣列,可能包含以下 item:

授權

Authorization
string
header
必填

在 API易控制台获取的 API Key

主體

application/json
model
enum<string>
預設值:deepseek-v4-flash-ga-260731
必填

模型 ID,固定 deepseek-v4-flash-ga-260731

可用選項:
deepseek-v4-flash-ga-260731
input
必填

输入内容。可为字符串,或 OpenAI Responses 标准的消息数组。纯文本,不支持图片

max_output_tokens
integer
預設值:500

最大输出 tokens,硬上限 393,216。思考内容也计入

必填範圍: x <= 393216
store
boolean
預設值:true

是否存储本轮响应。使用 previous_response_id 链式调用时需要为 true

previous_response_id
string

上一轮响应的 id。配合 caching 使用可整轮命中显式缓存

caching
object

显式缓存开关。首轮传 {"type": "enabled"} 写入,后续轮配合 previous_response_id 命中

reasoning
object

思考控制。实测 effort=minimal 时 reasoning_tokens 恒为 0;其余档位不构成单调阶梯

stream
boolean
預設值:false

是否流式输出(SSE)。实测 TTFB 约 2.3 秒

tools
object[]

工具列表。function 类型实测可用;web_search 已接通但后端报错,mcp 返回 AccessDenied

回應

生成成功

id
string

响应 ID,用作下一轮的 previous_response_id

model
string
output
object[]

输出项数组。可能包含 reasoning / message / function_call / web_search_call 等类型

caching
object

显式缓存状态回显

usage
object

用量。input_tokens_details.cached_tokens 为缓存命中量;output_tokens_details.reasoning_tokens 为思考消耗