deepseek-v4-flash-ga-260731)对应 DeepSeek 于 2026 年 7 月 31 日
转正式版的开源检查点 DeepSeek-V4-Flash-0731。架构与 4 月预览版一致(284B 总参 / 13B 激活 MoE、
1M 上下文),官方明确只重做了后训练阶段,但 agent 类基准大幅提升。API易 已完成
21 个用例实测 + 双端点专项复测,Chat Completions 与 Responses 均可直接调用。
API易已接入 DeepSeek V4 Flash 正式版:模型名
deepseek-v4-flash-ga-260731,
default / svip 分组可用。注意该模型默认思考量偏大,简单任务请显式传
thinking: {"type": "disabled"}(详见下方「思考控制」)。核心优势
1M 上下文实测扎实
输入硬上限 1,048,570 tokens。32.2 万 tokens 大海捞针 14.77 秒返回并准确命中,最大输出 393,216 tokens。
双层缓存降本
隐式缓存免配置、第 2 轮命中 99.9%;Responses 端显式缓存链式调用可整轮命中上一轮全部上下文。
高并发无限流
20 路并发全部 200,墙钟仅比单发慢 1.3 秒,适合高并发 agent 与批量文本任务。
极低单价
输入 $0.14、输出 $0.28 每 1M tokens,与 BytePlus 官方同价,缓存命中低至 $0.028。
模型信息
实测能力矩阵
以下为 API易 2026 年 8 月 5 日的实测结果(官方能力声明 vs 实际表现):思考控制
该模型默认思考量偏大——实测「9.11 和 9.9 哪个大」这类一句话问题也会花掉 263 个思考 token (同族deepseek-v4-flash 只花 44 个)。简单任务务必显式关闭:
缓存用法
隐式缓存(两端点自动生效)
同一段长前缀第 2 次请求即命中,实测 15,634 tokens 前缀命中 15,616(99.9%), 命中部分按 $0.028 / 百万 tokens 计费。显式缓存(Responses 端,需链式调用)
常见误用:把同一段长前缀重复发两次并带上caching,cached_tokens 会一直是 0。
正确姿势是首轮写入、后续轮用 previous_response_id 链下去:
快速开始
需要结构化输出时用 Function Call
response_format 在这个模型上不生效且不报错,是最容易踩的坑。工具参数才是真正被约束的:
定价
与 BytePlus 官方标价一致,可叠加 充值活动 进一步降低成本。
关于「不到旗舰十分之一」:厂商宣传语对标的是 V4-Pro 预览期的 $1.74 / $3.48。
按当前 V4-Pro 挂牌价($0.435 / $0.87)折算,本模型是约 1/3,不是 1/10。
相关页面
Chat Completions
OpenAI 兼容对话补全端点,在线调试
Responses
Responses 端点,支持显式缓存链式调用
上线说明与完整实测
基准数据、三方速度对照与踩坑记录
模型价格总表
全部模型的单价、端点与分组