Skip to main content
DeepSeek V4 Flash 正式版(deepseek-v4-flash-ga-260731)对应 DeepSeek 于 2026 年 7 月 31 日 转正式版的开源检查点 DeepSeek-V4-Flash-0731。架构与 4 月预览版一致(284B 总参 / 13B 激活 MoE、 1M 上下文),官方明确只重做了后训练阶段,但 agent 类基准大幅提升。API易 已完成 21 个用例实测 + 双端点专项复测,Chat Completions 与 Responses 均可直接调用。
API易已接入 DeepSeek V4 Flash 正式版:模型名 deepseek-v4-flash-ga-260731default / svip 分组可用。注意该模型默认思考量偏大,简单任务请显式传 thinking: {"type": "disabled"}(详见下方「思考控制」)。

核心优势

1M 上下文实测扎实

输入硬上限 1,048,570 tokens。32.2 万 tokens 大海捞针 14.77 秒返回并准确命中,最大输出 393,216 tokens。

双层缓存降本

隐式缓存免配置、第 2 轮命中 99.9%;Responses 端显式缓存链式调用可整轮命中上一轮全部上下文。

高并发无限流

20 路并发全部 200,墙钟仅比单发慢 1.3 秒,适合高并发 agent 与批量文本任务。

极低单价

输入 $0.14、输出 $0.28 每 1M tokens,与 BytePlus 官方同价,缓存命中低至 $0.028。

模型信息

实测能力矩阵

以下为 API易 2026 年 8 月 5 日的实测结果(官方能力声明 vs 实际表现):
三项与官方能力表不符,接入前请注意:结构化输出双端点均静默失效(返回 200 但完全无视 schema, 需要强约束请用 Function Call);联网搜索工具已接通但搜索后端持续报错、不返回 results; MCP 返回 AccessDenied(账号级内置工具权限,非模型限制)。

思考控制

该模型默认思考量偏大——实测「9.11 和 9.9 哪个大」这类一句话问题也会花掉 263 个思考 token (同族 deepseek-v4-flash 只花 44 个)。简单任务务必显式关闭:
reasoning_effort 不是单调档位。两道题 × 五档 × 5 次采样结果:high 在两道题上的思考量都比 low 少,档内方差(low 从 150 到 1993)远大于档间差异。 只有 minimal 可靠,不要把 low → max 当作成本旋钮。

缓存用法

隐式缓存(两端点自动生效)

同一段长前缀第 2 次请求即命中,实测 15,634 tokens 前缀命中 15,616(99.9%), 命中部分按 $0.028 / 百万 tokens 计费。
吃满隐式缓存的前提是前缀逐字节一致。把变动内容(时间戳、随机 ID、用户名) 放到 prompt 末尾,不要混进前缀里。

显式缓存(Responses 端,需链式调用)

常见误用:把同一段长前缀重复发两次并带上 cachingcached_tokens 会一直是 0。 正确姿势是首轮写入、后续轮用 previous_response_id 链下去:

快速开始

需要结构化输出时用 Function Call

response_format 在这个模型上不生效且不报错,是最容易踩的坑。工具参数才是真正被约束的:

定价

与 BytePlus 官方标价一致,可叠加 充值活动 进一步降低成本。
关于「不到旗舰十分之一」:厂商宣传语对标的是 V4-Pro 预览期的 $1.74 / $3.48。 按当前 V4-Pro 挂牌价($0.435 / $0.87)折算,本模型是约 1/3,不是 1/10。

相关页面

Chat Completions

OpenAI 兼容对话补全端点,在线调试

Responses

Responses 端点,支持显式缓存链式调用

上线说明与完整实测

基准数据、三方速度对照与踩坑记录

模型价格总表

全部模型的单价、端点与分组