Skip to main content
POST
Responses:DeepSeek V4 Flash 文本生成(支持显式缓存链式调用)
右侧 Playground 可直接调试:在 AuthorizationBearer sk-your-api-key。 默认示例已带 caching: {"type": "enabled"}store: true,是显式缓存链式调用的首轮写入形态。
Responses 端相比 Chat Completions 多一层显式缓存。模型能力、定价、思考控制详见 DeepSeek V4 Flash 概览
  • text.format 的 json_schema 不生效:返回 200 但完全无视 schema,3/3 次被代码围栏包裹导致解析失败
  • web_search 后端不可用:工具已接通(能看到 web_search_callstatus: completed),但 6/6 次搜索报错、不返回 results
  • mcp 返回 AccessDenied:账号 / 渠道级内置工具权限问题,换合法 server 地址结果相同
  • 纯文本模型,传图片会报 Model do not support image input

参数说明速查

显式缓存:必须走链式调用

常见误用:把同一段长前缀重复发两次并带上 cachingcached_tokens 会一直是 0。 显式缓存不是按前缀匹配的,必须用 previous_response_id 把会话链起来。
正确姿势:首轮传完整长文写入缓存,后续轮只传新问题并链上一轮的 id 每一轮把上一轮的全部上下文整体命中。做长文档连续追问时,这个模式比每轮重发全文省得多。

链式调用示例

隐式缓存

不传 caching 时隐式缓存同样生效,相同长前缀重复请求命中 99.9%(15,633 → 15,616)。 两种缓存可按场景选择:同一份前缀被很多独立请求复用走隐式缓存, 同一个会话连续多轮追问走显式缓存链式调用。

输出项类型

响应的 output 是数组,可能包含以下 item:

授权

Authorization
string
header
必填

在 API易控制台获取的 API Key

请求体

application/json
model
enum<string>
默认值:deepseek-v4-flash-ga-260731
必填

模型 ID,固定 deepseek-v4-flash-ga-260731

可用选项:
deepseek-v4-flash-ga-260731
input
必填

输入内容。可为字符串,或 OpenAI Responses 标准的消息数组。纯文本,不支持图片

max_output_tokens
integer
默认值:500

最大输出 tokens,硬上限 393,216。思考内容也计入

必填范围: x <= 393216
store
boolean
默认值:true

是否存储本轮响应。使用 previous_response_id 链式调用时需要为 true

previous_response_id
string

上一轮响应的 id。配合 caching 使用可整轮命中显式缓存

caching
object

显式缓存开关。首轮传 {"type": "enabled"} 写入,后续轮配合 previous_response_id 命中

reasoning
object

思考控制。实测 effort=minimal 时 reasoning_tokens 恒为 0;其余档位不构成单调阶梯

stream
boolean
默认值:false

是否流式输出(SSE)。实测 TTFB 约 2.3 秒

tools
object[]

工具列表。function 类型实测可用;web_search 已接通但后端报错,mcp 返回 AccessDenied

响应

生成成功

id
string

响应 ID,用作下一轮的 previous_response_id

model
string
output
object[]

输出项数组。可能包含 reasoning / message / function_call / web_search_call 等类型

caching
object

显式缓存状态回显

usage
object

用量。input_tokens_details.cached_tokens 为缓存命中量;output_tokens_details.reasoning_tokens 为思考消耗