deepseek-v4-flash-vision-exp 是 DeepSeek 的實驗性視覺模型,在 V4 Flash 的底座上加了影像輸入:
描述圖片、讀截圖裡的文字、認圖表數值、比較多張圖,都能直接做。文本側的能力(1M 上下文、
深度思考、函式呼叫、上下文快取)全部保留,定價也與純文本的 V4 Flash 完全一致 ——
看圖不額外加價,圖片按尺寸折成輸入 tokens 計費。
API易 已完成 124 個用例、約 1100 次呼叫的實測,覆蓋三種傳圖通道、四種圖片格式、
兩種協議、兩個分組。
核心優勢
看圖不加價
與純文本 V4 Flash 同價:輸入 $0.44、輸出 $1.32 每 1M tokens。圖片折成輸入 tokens,單圖最多 384。
實測識別紮實
截圖 OCR 數值全對、5 根柱狀圖讀數全對、36 個圖形裡數指定顏色形狀 24/24 全對,否定性提問不幻覺。
大圖不用預壓縮
2000×2000 與 4000×4000 折出的 tokens 完全相同(均 346),上游自己縮放。壓縮只省頻寬,不省錢。
兩種協議都能調
OpenAI 格式(chat/completions + responses)與 Anthropic 格式(/v1/messages)都實測可用,各走各的分組。
模型資訊
官方自 2026 年 8 月 17 日起對該模型採用峰谷兩檔計費(峰值時段為 01:00-04:00 與 06:00-10:00 (UTC),
即 09:00-12:00 與 14:00-18:00 (UTC+8))。本站固定按峰值檔計價,不隨時段浮動。
分組怎麼選
這個模型在 API易 掛了兩個分組,上游渠道不是同一個端點,所以能力不對等。 下表是 2026 年 8 月 21 日的實測結果(每格重複 3 次):用 OpenAI 格式 → 選 default 分組
在控制台建立令牌時把分組選成 default,然後:
用 Anthropic 格式 → 選 ClaudeCode 分組
在控制台建立令牌時把分組選成 ClaudeCode,然後:
三種傳圖方式
1. base64 內聯(最常用)
2. 公網圖片外鏈
Failed to download image。
3. file 內容塊(等價於 base64 內聯)
image_url 通道折出的 tokens 完全一致(同一張圖都是 303)。
圖片怎麼計費
圖片按縮放後的尺寸折成輸入 tokens,與文本 tokens 一起按 $0.44 / 1M 計價。 下面是 API易 實測資料(用同一段提示詞做差值,扣掉文本基線):
三條規律,實測與官方描述完全一致:
- 單圖上限 384 tokens。實測最大 354,怎麼放大都超不過
- 大圖會被縮到約 800×800 等效。所以 2000² 與 4000² 折出的 tokens 完全相同, 上傳前預壓縮只省頻寬、不省錢
- 小於 384×384 的圖會被放大。所以 64×64 和 384×384 花的錢一樣, 小圖不必刻意再縮
省下六成 token 的開關:detail: "low"
不需要看清細節時(判斷圖片型別、認主體、粗略分類),加上 detail: "low"
會把圖縮到 512×512 再推理:
深度思考控制
模型預設開啟深度思考,思考內容會計入max_tokens 配額。
純識圖任務建議直接關掉:實測關思考後 24/24 全對、更快,還省下思考的輸出 tokens,
輸入側也少 80 tokens(思考模式的系統提示詞固定佔這麼多)。
各寫法實測(每種 3 次):
上下文快取
無需任何引數,相同長字首重複請求會自動命中,命中部分按 $0.014 / 1M 計費。 但含圖請求有兩點和純文本不一樣:
實測(2304 tokens 的文本字首 + 一張 800×800 圖):
命中量恰好等於圖片之前那段文本,圖片本身與其後的內容每次都全價。
所以把固定的長指令放在圖片前面,能讓它進快取;放在圖片後面則永遠命中不了。
Anthropic 格式下這些欄位叫
cache_read_input_tokens / cache_creation_input_tokens,
行為一致。注意 cache_control 顯式快取標記不生效(上游用的是自動字首快取),
且兩種協議的 usage 口徑不同:OpenAI 格式的 prompt_tokens 是全量,
Anthropic 格式命中後 input_tokens 只剩未命中部分,不能直接對賬。支援的圖片格式
四種支援格式折出的 tokens 完全一致,選哪個都不影響成本。
實測能力矩陣
以下為 API易 2026 年 8 月 21 日的實測結果:視覺準確性抽查
限制與常見報錯
上下文的 1,048,576 是實測硬上限,且報錯顯示
max_tokens 會計入這個總量
(… in the messages, … in the completion)。拼滿長上下文時記得給輸出配額留位置,
否則會撞上限。You have uploaded an unsupported image—— 格式不在四種之列,或 base64 資料損壞Failed to download image—— 外鏈不通或超過 60 秒Image in assistant message is unsupported—— 圖片只能放在user訊息裡
實測約 1%~3% 的請求會出現連線被靜默關閉(客戶端表現為 SSL EOF 或握手超時),
與圖片無關、與分組無關,是通道層面的偶發現象。
客戶端務必設定讀超時並帶重試,否則單條請求可能掛住兩分鐘以上。
超時設定見 超時配置。
完整示例
OpenAI 格式(default 分組)
Anthropic 格式(ClaudeCode 分組)
相關文件
影像理解(識圖)API
各家識圖模型的通用呼叫方式與對比
DeepSeek V4 Flash 文本生成
同底座的純文本版本,1M 上下文與雙端點能力
分組怎麼選
Codex、ClaudeCode 和 Default 三個分組的區別與選擇建議
超時配置
客戶端讀超時與重試的推薦設定