deepseek-v4-flash-ga-260731)對應 DeepSeek 於 2026 年 7 月 31 日
轉正式版的開源檢查點 DeepSeek-V4-Flash-0731。架構與 4 月預覽版一致(284B 總參 / 13B 啟用 MoE、
1M 上下文),官方明確只重做了後訓練階段,但 agent 類基準大幅提升。API易 已完成
21 個用例實測 + 雙端點專項複測,Chat Completions 與 Responses 均可直接呼叫。
API易已接入 DeepSeek V4 Flash 正式版:模型名
deepseek-v4-flash-ga-260731,
default / svip 分組可用。注意該模型預設思考量偏大,簡單任務請顯式傳
thinking: {"type": "disabled"}(詳見下方「思考控制」)。核心優勢
1M 上下文實測紮實
輸入硬上限 1,048,570 tokens。32.2 萬 tokens 大海撈針 14.77 秒返回並準確命中,最大輸出 393,216 tokens。
雙層快取降本
隱式快取免配置、第 2 輪命中 99.9%;Responses 端顯式快取鏈式呼叫可整輪命中上一輪全部上下文。
高併發無限流
20 路併發全部 200,牆鍾僅比單發慢 1.3 秒,適合高併發 agent 與批次文本任務。
極低單價
輸入 $0.14、輸出 $0.28 每 1M tokens,與 BytePlus 官方同價,快取命中低至 $0.028。
模型資訊
實測能力矩陣
以下為 API易 2026 年 8 月 5 日的實測結果(官方能力宣告 vs 實際表現):思考控制
該模型預設思考量偏大——實測「9.11 和 9.9 哪個大」這類一句話問題也會花掉 263 個思考 token (同族deepseek-v4-flash 只花 44 個)。簡單任務務必顯式關閉:
快取用法
隱式快取(兩端點自動生效)
同一段長字首第 2 次請求即命中,實測 15,634 tokens 字首命中 15,616(99.9%), 命中部分按 $0.028 / 百萬 tokens 計費。顯式快取(Responses 端,需鏈式呼叫)
常見誤用:把同一段長字首重複發兩次並帶上caching,cached_tokens 會一直是 0。
正確姿勢是首輪寫入、後續輪用 previous_response_id 鏈下去:
快速開始
需要結構化輸出時用 Function Call
response_format 在這個模型上不生效且不報錯,是最容易踩的坑。工具引數才是真正被約束的:
定價
與 BytePlus 官方標價一致,可疊加 充值活動 進一步降低成本。
關於「不到旗艦十分之一」:廠商宣傳語對標的是 V4-Pro 預覽期的 $1.74 / $3.48。
按當前 V4-Pro 掛牌價($0.435 / $0.87)折算,本模型是約 1/3,不是 1/10。
相關頁面
Chat Completions
OpenAI 相容對話補全端點,線上除錯
Responses
Responses 端點,支援顯式快取鏈式呼叫
上線說明與完整實測
基準資料、三方速度對照與踩坑記錄
模型價格總表
全部模型的單價、端點與分組