Skip to main content
POST
对话补全:DeepSeek V4 Flash 文本生成
右側 Playground 可直接除錯:在 AuthorizationBearer sk-your-api-key, 預設示例已關閉深度思考(thinking.disabled),點擊發送即可快速看到響應。
該模型預設思考量偏大,一句話問題也會先輸出數百 tokens 思考內容。除錯建議保持示例中的 "thinking": {"type": "disabled"}。模型能力、定價、快取機制詳見 DeepSeek V4 Flash 概覽
  • 開啟思考時 max_tokens 要給足(思考內容計入輸出配額),建議 3000+
  • response_format 不生效:傳 json_schema 返回 200 但完全無視 schema,需要結構化輸出請用 tools
  • n 引數靜默忽略:傳 n=2 返回 200,但 choices 裡恆為 1 個元素
  • 純文本模型,傳圖片內容塊會報 Model do not support image input

引數說明速查

上下文與輸出上限

實測 322,055 tokens 的輸入 14.77 秒返回,並準確撈出埋在中段的資訊。

隱式快取

無需任何引數,相同長字首第 2 次請求即命中: 命中部分按 $0.028 / 百萬 tokens 計費。把時間戳、隨機 ID 等變動內容放到 prompt 末尾, 不要混進字首,否則命中率歸零。

需要結構化輸出?用 tools

choices[0].message.tool_calls[0].function.arguments 取 JSON 字串,可直接解析。

授權

Authorization
string
header
必填

在 API易控制台获取的 API Key

主體

application/json
model
enum<string>
預設值:deepseek-v4-flash-ga-260731
必填

模型 ID,固定 deepseek-v4-flash-ga-260731

可用選項:
deepseek-v4-flash-ga-260731
messages
object[]
必填

对话消息数组,OpenAI 标准格式。纯文本,不支持图片内容块

max_tokens
integer
預設值:500

最大输出 tokens,硬上限 393,216。开启思考时思考内容也计入,建议给足

必填範圍: x <= 393216
thinking
object

深度思考开关。传 {"type": "disabled"} 可关闭,实测简单任务可省 200+ 思考 tokens

reasoning_effort
enum<string>

思考深度分档。实测仅 minimal 确定性生效(思考 tokens 恒为 0);low/medium/high/max 不构成单调阶梯,档内方差大于档间差异

可用選項:
minimal,
low,
medium,
high,
max
stream
boolean
預設值:false

是否流式输出(SSE)。配合 stream_options.include_usage 可在末尾获取用量

temperature
number

采样温度

top_p
number

核采样阈值

stop
string[]

停止词,实测真实截断生效

seed
integer

随机种子

logprobs
boolean

是否返回 token 对数概率,实测有内容返回

tools
object[]

Function Call 工具列表,OpenAI 标准格式。工具参数是真正被约束的,需要结构化输出时用它替代 response_format

回應

对话补全成功

id
string

请求 ID

model
string
choices
object[]

补全结果。message 中除 content 外,开启思考时还有 reasoning_content 字段

usage
object

用量。completion_tokens_details.reasoning_tokens 为思考消耗;prompt_tokens_details.cached_tokens 为隐式缓存命中量