deepseek-v4-flash-vision-exp 是 DeepSeek 的实验性视觉模型,在 V4 Flash 的底座上加了图像输入:
描述图片、读截图里的文字、认图表数值、比较多张图,都能直接做。文本侧的能力(1M 上下文、
深度思考、函数调用、上下文缓存)全部保留,定价也与纯文本的 V4 Flash 完全一致 ——
看图不额外加价,图片按尺寸折成输入 tokens 计费。
API易 已完成 124 个用例、约 1100 次调用的实测,覆盖三种传图通道、四种图片格式、
两种协议、两个分组。
核心优势
看图不加价
与纯文本 V4 Flash 同价:输入 $0.44、输出 $1.32 每 1M tokens。图片折成输入 tokens,单图最多 384。
实测识别扎实
截图 OCR 数值全对、5 根柱状图读数全对、36 个图形里数指定颜色形状 24/24 全对,否定性提问不幻觉。
大图不用预压缩
2000×2000 与 4000×4000 折出的 tokens 完全相同(均 346),上游自己缩放。压缩只省带宽,不省钱。
两种协议都能调
OpenAI 格式(chat/completions + responses)与 Anthropic 格式(/v1/messages)都实测可用,各走各的分组。
模型信息
官方自 2026 年 8 月 17 日起对该模型采用峰谷两档计费(峰值时段为 01:00-04:00 与 06:00-10:00 (UTC),
即 09:00-12:00 与 14:00-18:00 (UTC+8))。本站固定按峰值档计价,不随时段浮动。
分组怎么选
这个模型在 API易 挂了两个分组,上游渠道不是同一个端点,所以能力不对等。 下表是 2026 年 8 月 21 日的实测结果(每格重复 3 次):用 OpenAI 格式 → 选 default 分组
在控制台创建令牌时把分组选成 default,然后:
用 Anthropic 格式 → 选 ClaudeCode 分组
在控制台创建令牌时把分组选成 ClaudeCode,然后:
三种传图方式
1. base64 内联(最常用)
2. 公网图片外链
Failed to download image。
3. file 内容块(等价于 base64 内联)
image_url 通道折出的 tokens 完全一致(同一张图都是 303)。
图片怎么计费
图片按缩放后的尺寸折成输入 tokens,与文本 tokens 一起按 $0.44 / 1M 计价。 下面是 API易 实测数据(用同一段提示词做差值,扣掉文本基线):
三条规律,实测与官方描述完全一致:
- 单图上限 384 tokens。实测最大 354,怎么放大都超不过
- 大图会被缩到约 800×800 等效。所以 2000² 与 4000² 折出的 tokens 完全相同, 上传前预压缩只省带宽、不省钱
- 小于 384×384 的图会被放大。所以 64×64 和 384×384 花的钱一样, 小图不必刻意再缩
省下六成 token 的开关:detail: "low"
不需要看清细节时(判断图片类型、认主体、粗略分类),加上 detail: "low"
会把图缩到 512×512 再推理:
深度思考控制
模型默认开启深度思考,思考内容会计入max_tokens 配额。
纯识图任务建议直接关掉:实测关思考后 24/24 全对、更快,还省下思考的输出 tokens,
输入侧也少 80 tokens(思考模式的系统提示词固定占这么多)。
各写法实测(每种 3 次):
上下文缓存
无需任何参数,相同长前缀重复请求会自动命中,命中部分按 $0.014 / 1M 计费。 但含图请求有两点和纯文本不一样:
实测(2304 tokens 的文本前缀 + 一张 800×800 图):
命中量恰好等于图片之前那段文本,图片本身与其后的内容每次都全价。
所以把固定的长指令放在图片前面,能让它进缓存;放在图片后面则永远命中不了。
Anthropic 格式下这些字段叫
cache_read_input_tokens / cache_creation_input_tokens,
行为一致。注意 cache_control 显式缓存标记不生效(上游用的是自动前缀缓存),
且两种协议的 usage 口径不同:OpenAI 格式的 prompt_tokens 是全量,
Anthropic 格式命中后 input_tokens 只剩未命中部分,不能直接对账。支持的图片格式
四种支持格式折出的 tokens 完全一致,选哪个都不影响成本。
实测能力矩阵
以下为 API易 2026 年 8 月 21 日的实测结果:视觉准确性抽查
限制与常见报错
上下文的 1,048,576 是实测硬上限,且报错显示
max_tokens 会计入这个总量
(… in the messages, … in the completion)。拼满长上下文时记得给输出配额留位置,
否则会撞上限。You have uploaded an unsupported image—— 格式不在四种之列,或 base64 数据损坏Failed to download image—— 外链不通或超过 60 秒Image in assistant message is unsupported—— 图片只能放在user消息里
实测约 1%~3% 的请求会出现连接被静默关闭(客户端表现为 SSL EOF 或握手超时),
与图片无关、与分组无关,是通道层面的偶发现象。
客户端务必设置读超时并带重试,否则单条请求可能挂住两分钟以上。
超时设置见 超时配置。
完整示例
OpenAI 格式(default 分组)
Anthropic 格式(ClaudeCode 分组)
相关文档
图像理解(识图)API
各家识图模型的通用调用方式与对比
DeepSeek V4 Flash 文本生成
同底座的纯文本版本,1M 上下文与双端点能力
分组怎么选
Codex、ClaudeCode 和 Default 三个分组的区别与选择建议
超时配置
客户端读超时与重试的推荐设置