核心要点
- 正式版上线:
deepseek-v4-flash-ga-260731已上架,对应开源版DeepSeek-V4-Flash-0731,2026 年 7 月 31 日转正式版 - 架构未变,后训练重做:仍是 284B 总参 / 13B 激活的 MoE,官方明确只重做了后训练阶段,agent 类基准大幅提升
- 五项 agent 基准反超 Pro 预览版:Terminal Bench 2.1 达 82.7(Flash 预览版 61.8 / Pro 预览版 72.1)
- 实测长文能力扎实:32.2 万 tokens 上下文 14.77 秒返回并准确捞出中段信息;上下文硬上限 1,048,570 tokens
- 隐式缓存免配置:同前缀第二轮命中 15616/15634,命中率 99.9%,命中部分按 $0.028 / 百万 tokens 计费
- 价格:输入 $0.14 / 输出 $0.28 每百万 tokens,与 BytePlus 官方同价,叠加充值活动可再降
- 双端点可用:Chat Completions 与 Responses 均已开通,Responses 端显式缓存链式调用可整轮命中
- 三个坑要绕开:结构化输出静默失效、联网搜索后端持续报错、
reasoning_effort不是单调档位
本文的性能与兼容性数据来自 API易 在 2026-08-05 的实测,测试脚本与原始日志可复现。
基准分数为厂商自评数据,来源:
huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731。背景介绍
2026 年 4 月,DeepSeek 发布 V4 预览版,一次带来 V4-Pro 和 V4-Flash 两款模型。三个月后的 7 月 31 日,Flash 线率先转正式版,检查点命名为 DeepSeek-V4-Flash-0731。 这次更新有个容易被忽略的关键点:它不是一个新模型。官方说得很直白——架构、参数量、 上下文长度全部与 4 月的预览版一致(284B 总参 / 13B 激活 MoE、1M 上下文、384K 最大输出), 改动只发生在后训练阶段。 但后训练带来的提升幅度相当反直觉。在厂商自评的 agent 类基准上,正式版不仅大幅超过自己的 预览版,还越过了同代的 V4-Pro 预览版:
DeepSWE 从 7.3 到 54.4,这个跨度已经不是「调优」能解释的量级。不过要提醒一句:
这些是厂商自评数据,目前没有第三方复现。Artificial Analysis 给出的通用智能指数是 50,
属于通用能力测量,不是 agent 专项。
详细解析
我们实测了什么
模型能力表是一回事,接到网关上能不能用是另一回事。我们跑了 21 个用例 + 三方对照 + 思考档位专项, 下面是结论。长上下文:这是它最强的部分
先确认上限——发一个超长请求,网关直接给出硬数字:
32 万 tokens 上下文、14.8 秒返回、准确捞出中段埋的信息。这个成绩放在同价位段里相当突出。
隐式缓存:免配置,第二轮就命中
用同一段 15.6k tokens 的前缀连发三轮,间隔 5 秒:
不需要任何参数,第二轮几乎全量命中。命中部分按 $0.028 / 百万 tokens 计费,
相当于重复前缀省 80%。做长文档多轮问答、固定 system prompt 的批量任务,这一项直接决定成本。
显式缓存:走 Responses 链式调用
Chat 与 Responses 两个端点都已开通。Responses 端还多一层显式缓存,但它的用法 容易搞错——不是把同一段长前缀重复发两次(那样cached_tokens 一直是 0),
而是首轮带 caching: {"type": "enabled"} 写入,后续轮用 previous_response_id 链下去:
每一轮把上一轮的全部上下文整体命中。做多轮长上下文会话(如长文档连续追问),
这个模式比每轮重发全文省得多。
并发:20 路零限流
同一把 Key 无预热直接打并发:
20 并发全部成功,墙钟只比单发慢 1.3 秒,没有排队感。「高并发 agent 场景」这个定位站得住。
速度对照:不是一边倒
四道题与deepseek-v4-flash(0423 预览版通道)、deepseek-v4-pro 对照,均为默认思考档:
四题答案全部正确(含 9.11 与 9.9 比大小这道经典陷阱题)。但速度结论不是一边倒:
- 数学、代码这类结构明确的题,正式版比预览版通道快 30~37%,且成本更低
- 逻辑题和陷阱题上正式版反而更慢,因为它默认思考得更多——陷阱题上花了 263 个思考 token, 预览版只花 44 个
三个必须绕开的坑
坑一:结构化输出参数收但不约束
官方能力表把结构化输出标为不支持,实测确认,且失效方式很隐蔽:- 带
response_format: json_schema不会报错(HTTP 200) - 但 prompt 里不含 “json” 字样时上游会 400 —— 这说明它是 OpenAI 兼容层的提示词式实现,不是原生约束解码
- prompt 里带 “json” 后,模型完全无视 schema
{"answer": string} 加 strict: true 在两个端点各测 3 次,返回的键是
name / englishName / country / coordinates / population…,和 schema 毫无关系;
Chat 端 2/3 次、Responses 端 3/3 次被代码围栏包裹,json.loads() 直接失败。
替代方案:需要结构化输出请走 Function Call。工具参数是真正被约束的,实测稳定。
坑二:联网搜索工具接通了,但后端取不到结果
这一项和能力表的差异最微妙:web_search 工具本身已经接通——响应的 output
里能看到 web_search_call item,status 也是 completed,看起来一切正常。
但搜索后端持续失败。6 次独立测试、共 17 次搜索调用,模型每次都回复「搜索服务暂时出现异常」
「多次尝试均报错,未能获取实时信息」;web_search_call 的字段只有
action / id / status / type,不含 results。
6/6 全部失败,不是偶发。链路通、后端不可用,当前不建议用于生产。
同一批测试里 MCP 稳定返回 AccessDenied(you do not have access to the built in tool),
换成合法的公共 MCP server 地址结果相同——这是账号 / 渠道级的内置工具权限问题,
不是模型能力限制。
坑三:reasoning_effort 不是单调档位
两道题 × 五档 × 5 次采样,思考 token 中位数:high 的思考量在两道题上都比 low 少,档内方差远大于档间差异。
把它当成本旋钮用会得到不可预期的结果。
只有 minimal 是可靠的——它等价于关闭思考。要控成本就用它,
不要指望 low → max 线性加深。
附带发现:n>1 静默忽略
传n=2 返回 200,但 choices 数组里只有 1 个元素。其余采样参数
(temperature、top_p、stop、logprobs、seed、双 penalty)实测均正常。
实际应用
推荐场景
适合
- 高并发日常问答与文本处理
- 长文档摘要与问答(32 万 tokens 实测 15 秒)
- 需要工具调用的轻量 agent
- 固定 system prompt 的批量任务(吃隐式缓存)
- 多轮长上下文会话(Responses 链式显式缓存)
避开
- 需要
json_schema强约束(改用 Function Call) - 依赖联网搜索或 MCP(后端 / 权限未就绪)
- Claude Code 接入(未开 Anthropic 端点)
- 任何图片输入场景(纯文本模型)
代码示例
简单任务显式关闭思考,避免为一句话答案付出几百 token 的思考开销:response_format:
最佳实践
1
简单任务显式关思考
正式版默认思考量偏大,
thinking: {"type": "disabled"} 或
reasoning_effort: "minimal" 都能可靠关闭。2
把变动内容放 prompt 末尾
隐式缓存要求前缀逐字节一致。时间戳、随机 ID 混进前缀会让命中率归零。
3
结构化输出一律走 Function Call
response_format 在这个模型上不生效且不报错,是最容易踩的坑。4
多轮长会话走 Responses 链式调用
首轮带
caching: {"type": "enabled"},后续用 previous_response_id 链下去,
上一轮上下文可整轮命中缓存。5
不要依赖联网搜索与 MCP
web_search 工具接通但后端持续报错,MCP 返回 AccessDenied,两项当前都取不到结果。价格与可用性
定价信息
与 BytePlus 官方标价一致。可用分组:
default、svip。
关于「不到旗舰十分之一」这个说法:厂商宣传语对标的是 V4-Pro 预览期的
$1.74 / $3.48。按当前 V4-Pro 挂牌价折算,正式版是约 1/3,不是 1/10。
我们按实际挂牌价说明,不沿用旧口径。
叠加网站充值活动
在上述价格基础上,还可叠加 API易 的充值加赠活动进一步降低实际成本, 详见 充值活动说明。总结与建议
DeepSeek-V4-Flash-0731 是一次「只改后训练但效果显著」的更新。从我们的实测看, 它的强项非常明确:长上下文、隐式缓存、并发吞吐——32 万 tokens 15 秒返回、 二轮缓存命中 99.9%、20 并发零限流,这三项配合 $0.14 的输入价, 做长文档处理和高并发文本任务的性价比很高。 同时要清楚它现在的边界:这是一个纯文本模型,不吃图片,也没开 Anthropic 端点, 接不了 Claude Code。结构化输出在两个端点上都不生效,reasoning_effort 不是个可靠旋钮,
联网搜索和 MCP 目前也取不到结果。这些不是缺陷描述,而是接入前需要知道的事实——
知道了就能绕开,不知道就会在联调时浪费半天。
选型建议:日常高并发问答、长文档、多轮长会话、轻量工具调用 agent 选正式版;
需要 Claude Code 接入选 deepseek-v4-flash。
数据来源与获取日期:API易 实测(2026-08-05,21 个用例 + 三方对照 + 思考档位专项
- Responses 端点专项复测);基准分数为厂商自评,来自
huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731;V4 预览版背景信息来自api-docs.deepseek.com/news/news260424。基准数据目前无第三方复现, 请结合自身场景实测后再做选型决策。
更正说明:本文首发时曾记录「Responses 端点未接通」,该现象为渠道侧配置问题,
已于 2026-08-05 当日修正。复测后 Responses 全面可用、显式缓存正常,相关章节已更新。