Skip to main content
deepseek-v4-flash-vision-exp 是 DeepSeek 的實驗性視覺模型,在 V4 Flash 的底座上加了影像輸入: 描述圖片、讀截圖裡的文字、認圖表數值、比較多張圖,都能直接做。文本側的能力(1M 上下文、 深度思考、函式呼叫、上下文快取)全部保留,定價也與純文本的 V4 Flash 完全一致 —— 看圖不額外加價,圖片按尺寸折成輸入 tokens 計費 API易 已完成 124 個用例、約 1100 次呼叫的實測,覆蓋三種傳圖通道、四種圖片格式、 兩種協議、兩個分組。
呼叫前必讀:這個模型在 API易 有兩個分組,能力不一樣,必須按你用的協議選。選錯不會提示”分組錯誤”,而是表現成引數不生效、第二輪 400、responses 報 messages 的錯。 兩個分組同價,選分組隻影響能力,不影響計費。詳見下方「分組怎麼選」。

核心優勢

看圖不加價

與純文本 V4 Flash 同價:輸入 $0.44、輸出 $1.32 每 1M tokens。圖片折成輸入 tokens,單圖最多 384。

實測識別紮實

截圖 OCR 數值全對、5 根柱狀圖讀數全對、36 個圖形裡數指定顏色形狀 24/24 全對,否定性提問不幻覺。

大圖不用預壓縮

2000×2000 與 4000×4000 折出的 tokens 完全相同(均 346),上游自己縮放。壓縮只省頻寬,不省錢。

兩種協議都能調

OpenAI 格式(chat/completions + responses)與 Anthropic 格式(/v1/messages)都實測可用,各走各的分組。

模型資訊

官方自 2026 年 8 月 17 日起對該模型採用峰谷兩檔計費(峰值時段為 01:00-04:00 與 06:00-10:00 (UTC), 即 09:00-12:00 與 14:00-18:00 (UTC+8))。本站固定按峰值檔計價,不隨時段浮動。

分組怎麼選

這個模型在 API易 掛了兩個分組,上游渠道不是同一個端點,所以能力不對等。 下表是 2026 年 8 月 21 日的實測結果(每格重複 3 次):

用 OpenAI 格式 → 選 default 分組

在控制台建立令牌時把分組選成 default,然後:

用 Anthropic 格式 → 選 ClaudeCode 分組

在控制台建立令牌時把分組選成 ClaudeCode,然後:
一個賬號可以同時建多個不同分組的令牌,互不影響 —— 建議就按協議各留一把。 分組的作用和建立方式見 分組是什麼令牌與分組,三個分組的區別見 Codex、ClaudeCode 和 Default 分組有什麼區別
Anthropic 格式千萬別用 default 分組,會撞上兩個疊加問題:
  1. 不顯式傳 top_p 一律返回 400 Invalid top_p value
  2. 就算補上 top_p,第一輪返回的 thinking 塊原樣回傳到第二輪時會報 unknown variant 'thinking' —— 而 Claude Code、Anthropic SDK 這類標準客戶端 一定會原樣回傳,所以多輪必斷
換成 ClaudeCode 分組,這兩個問題都不存在,工具呼叫閉環也完整可用。

三種傳圖方式

1. base64 內聯(最常用)

2. 公網圖片外鏈

外鏈長度上限 8192 字元,圖片需在 60 秒內下載完成。連結不通會返回 Failed to download image

3. file 內容塊(等價於 base64 內聯)

實測與 image_url 通道折出的 tokens 完全一致(同一張圖都是 303)。
Files API(/v1/files 上傳後用 file_id 引用)在 API易 不可用, 這是第三方中轉平臺的普遍情況。因此官方給 file_id 留的兩個額度 —— 單圖 64 MiB、單請求總量 200 MiB —— 也拿不到。實際能用的上限是:單圖 ≤ 32 MiB、單請求體 ≤ 48 MiB。 超了會返回 image file size exceeds limit 32 MB

圖片怎麼計費

圖片按縮放後的尺寸折成輸入 tokens,與文本 tokens 一起按 $0.44 / 1M 計價。 下面是 API易 實測資料(用同一段提示詞做差值,扣掉文本基線): 三條規律,實測與官方描述完全一致:
  • 單圖上限 384 tokens。實測最大 354,怎麼放大都超不過
  • 大圖會被縮到約 800×800 等效。所以 2000² 與 4000² 折出的 tokens 完全相同, 上傳前預壓縮只省頻寬、不省錢
  • 小於 384×384 的圖會被放大。所以 64×64 和 384×384 花的錢一樣, 小圖不必刻意再縮

省下六成 token 的開關:detail: "low"

不需要看清細節時(判斷圖片型別、認主體、粗略分類),加上 detail: "low" 會把圖縮到 512×512 再推理:
四個檔位實測(1600×1200 同一張圖):
detail 只在兩個條件同時滿足時生效:走 image_url 通道(放在 file 塊上會被靜默忽略), 且令牌是 default 分組ClaudeCode 分組下不生效)。填了非法值會明確報錯:unknown variant 'ultra', expected one of 'low', 'high', 'original', 'auto'

深度思考控制

模型預設開啟深度思考,思考內容會計入 max_tokens 配額。 純識圖任務建議直接關掉:實測關思考後 24/24 全對、更快,還省下思考的輸出 tokens, 輸入側也少 80 tokens(思考模式的系統提示詞固定佔這麼多)。 各寫法實測(每種 3 次):
max_tokens 別給小。開著思考時,一句話問題也可能先輸出幾百 tokens 的思考內容, 給小了會 finish_reason: "length"content 為空字串 —— 看起來像模型沒回答。 開思考建議 2000 以上;或者乾脆關掉思考。

上下文快取

無需任何引數,相同長字首重複請求會自動命中,命中部分按 $0.014 / 1M 計費。 但含圖請求有兩點和純文本不一樣 實測(2304 tokens 的文本字首 + 一張 800×800 圖): 命中量恰好等於圖片之前那段文本,圖片本身與其後的內容每次都全價。 所以把固定的長指令放在圖片前面,能讓它進快取;放在圖片後面則永遠命中不了。
Anthropic 格式下這些欄位叫 cache_read_input_tokens / cache_creation_input_tokens, 行為一致。注意 cache_control 顯式快取標記不生效(上游用的是自動字首快取), 且兩種協議的 usage 口徑不同:OpenAI 格式的 prompt_tokens 是全量, Anthropic 格式命中後 input_tokens 只剩未命中部分,不能直接對賬

支援的圖片格式

四種支援格式折出的 tokens 完全一致,選哪個都不影響成本。
格式按檔案內容判斷,不看你宣告的 MIME。實測把 PNG 謊報成 image/jpeg 照樣正常工作 —— 所以副檔名寫錯、MIME 填錯都不影響,只要檔案本身是這四種格式之一。

實測能力矩陣

以下為 API易 2026 年 8 月 21 日的實測結果:

視覺準確性抽查

限制與常見報錯

上下文的 1,048,576 是實測硬上限,且報錯顯示 max_tokens 會計入這個總量… in the messages, … in the completion)。拼滿長上下文時記得給輸出配額留位置, 否則會撞上限。
其它常見 400:
  • You have uploaded an unsupported image —— 格式不在四種之列,或 base64 資料損壞
  • Failed to download image —— 外鏈不通或超過 60 秒
  • Image in assistant message is unsupported —— 圖片只能放在 user 訊息裡
實測約 1%~3% 的請求會出現連線被靜默關閉(客戶端表現為 SSL EOF 或握手超時), 與圖片無關、與分組無關,是通道層面的偶發現象。 客戶端務必設定讀超時並帶重試,否則單條請求可能掛住兩分鐘以上。 超時設定見 超時配置

完整示例

OpenAI 格式(default 分組)

Anthropic 格式(ClaudeCode 分組)

相關文件

影像理解(識圖)API

各家識圖模型的通用呼叫方式與對比

DeepSeek V4 Flash 文本生成

同底座的純文本版本,1M 上下文與雙端點能力

分組怎麼選

Codex、ClaudeCode 和 Default 三個分組的區別與選擇建議

超時配置

客戶端讀超時與重試的推薦設定