Skip to main content
DeepSeek V4 Flash 正式版(deepseek-v4-flash-ga-260731)對應 DeepSeek 於 2026 年 7 月 31 日 轉正式版的開源檢查點 DeepSeek-V4-Flash-0731。架構與 4 月預覽版一致(284B 總參 / 13B 啟用 MoE、 1M 上下文),官方明確只重做了後訓練階段,但 agent 類基準大幅提升。API易 已完成 21 個用例實測 + 雙端點專項複測,Chat Completions 與 Responses 均可直接呼叫。
API易已接入 DeepSeek V4 Flash 正式版:模型名 deepseek-v4-flash-ga-260731default / svip 分組可用。注意該模型預設思考量偏大,簡單任務請顯式傳 thinking: {"type": "disabled"}(詳見下方「思考控制」)。

核心優勢

1M 上下文實測紮實

輸入硬上限 1,048,570 tokens。32.2 萬 tokens 大海撈針 14.77 秒返回並準確命中,最大輸出 393,216 tokens。

雙層快取降本

隱式快取免配置、第 2 輪命中 99.9%;Responses 端顯式快取鏈式呼叫可整輪命中上一輪全部上下文。

高併發無限流

20 路併發全部 200,牆鍾僅比單發慢 1.3 秒,適合高併發 agent 與批次文本任務。

極低單價

輸入 $0.14、輸出 $0.28 每 1M tokens,與 BytePlus 官方同價,快取命中低至 $0.028。

模型資訊

實測能力矩陣

以下為 API易 2026 年 8 月 5 日的實測結果(官方能力宣告 vs 實際表現):
三項與官方能力表不符,接入前請注意:結構化輸出雙端點均靜默失效(返回 200 但完全無視 schema, 需要強約束請用 Function Call);聯網搜尋工具已接通但搜尋後端持續報錯、不返回 results; MCP 返回 AccessDenied(賬號級內建工具權限,非模型限制)。

思考控制

該模型預設思考量偏大——實測「9.11 和 9.9 哪個大」這類一句話問題也會花掉 263 個思考 token (同族 deepseek-v4-flash 只花 44 個)。簡單任務務必顯式關閉:
reasoning_effort 不是單調檔位。兩道題 × 五檔 × 5 次取樣結果:high 在兩道題上的思考量都比 low 少,檔內方差(low 從 150 到 1993)遠大於檔間差異。 只有 minimal 可靠,不要把 low → max 當作成本旋鈕。

快取用法

隱式快取(兩端點自動生效)

同一段長字首第 2 次請求即命中,實測 15,634 tokens 字首命中 15,616(99.9%), 命中部分按 $0.028 / 百萬 tokens 計費。
吃滿隱式快取的前提是字首逐位元組一致。把變動內容(時間戳、隨機 ID、使用者名稱) 放到 prompt 末尾,不要混進字首裡。

顯式快取(Responses 端,需鏈式呼叫)

常見誤用:把同一段長字首重複發兩次並帶上 cachingcached_tokens 會一直是 0。 正確姿勢是首輪寫入、後續輪用 previous_response_id 鏈下去:

快速開始

需要結構化輸出時用 Function Call

response_format 在這個模型上不生效且不報錯,是最容易踩的坑。工具引數才是真正被約束的:

定價

與 BytePlus 官方標價一致,可疊加 充值活動 進一步降低成本。
關於「不到旗艦十分之一」:廠商宣傳語對標的是 V4-Pro 預覽期的 $1.74 / $3.48。 按當前 V4-Pro 掛牌價($0.435 / $0.87)折算,本模型是約 1/3,不是 1/10。

相關頁面

Chat Completions

OpenAI 相容對話補全端點,線上除錯

Responses

Responses 端點,支援顯式快取鏈式呼叫

上線說明與完整實測

基準資料、三方速度對照與踩坑記錄

模型價格總表

全部模型的單價、端點與分組