Skip to main content
deepseek-v4-flash-vision-exp 是 DeepSeek 的实验性视觉模型,在 V4 Flash 的底座上加了图像输入: 描述图片、读截图里的文字、认图表数值、比较多张图,都能直接做。文本侧的能力(1M 上下文、 深度思考、函数调用、上下文缓存)全部保留,定价也与纯文本的 V4 Flash 完全一致 —— 看图不额外加价,图片按尺寸折成输入 tokens 计费 API易 已完成 124 个用例、约 1100 次调用的实测,覆盖三种传图通道、四种图片格式、 两种协议、两个分组。
调用前必读:这个模型在 API易 有两个分组,能力不一样,必须按你用的协议选。选错不会提示”分组错误”,而是表现成参数不生效、第二轮 400、responses 报 messages 的错。 两个分组同价,选分组只影响能力,不影响计费。详见下方「分组怎么选」。

核心优势

看图不加价

与纯文本 V4 Flash 同价:输入 $0.44、输出 $1.32 每 1M tokens。图片折成输入 tokens,单图最多 384。

实测识别扎实

截图 OCR 数值全对、5 根柱状图读数全对、36 个图形里数指定颜色形状 24/24 全对,否定性提问不幻觉。

大图不用预压缩

2000×2000 与 4000×4000 折出的 tokens 完全相同(均 346),上游自己缩放。压缩只省带宽,不省钱。

两种协议都能调

OpenAI 格式(chat/completions + responses)与 Anthropic 格式(/v1/messages)都实测可用,各走各的分组。

模型信息

官方自 2026 年 8 月 17 日起对该模型采用峰谷两档计费(峰值时段为 01:00-04:00 与 06:00-10:00 (UTC), 即 09:00-12:00 与 14:00-18:00 (UTC+8))。本站固定按峰值档计价,不随时段浮动。

分组怎么选

这个模型在 API易 挂了两个分组,上游渠道不是同一个端点,所以能力不对等。 下表是 2026 年 8 月 21 日的实测结果(每格重复 3 次):

用 OpenAI 格式 → 选 default 分组

在控制台创建令牌时把分组选成 default,然后:

用 Anthropic 格式 → 选 ClaudeCode 分组

在控制台创建令牌时把分组选成 ClaudeCode,然后:
一个账号可以同时建多个不同分组的令牌,互不影响 —— 建议就按协议各留一把。 分组的作用和创建方式见 分组是什么令牌与分组,三个分组的区别见 Codex、ClaudeCode 和 Default 分组有什么区别
Anthropic 格式千万别用 default 分组,会撞上两个叠加问题:
  1. 不显式传 top_p 一律返回 400 Invalid top_p value
  2. 就算补上 top_p,第一轮返回的 thinking 块原样回传到第二轮时会报 unknown variant 'thinking' —— 而 Claude Code、Anthropic SDK 这类标准客户端 一定会原样回传,所以多轮必断
换成 ClaudeCode 分组,这两个问题都不存在,工具调用闭环也完整可用。

三种传图方式

1. base64 内联(最常用)

2. 公网图片外链

外链长度上限 8192 字符,图片需在 60 秒内下载完成。链接不通会返回 Failed to download image

3. file 内容块(等价于 base64 内联)

实测与 image_url 通道折出的 tokens 完全一致(同一张图都是 303)。
Files API(/v1/files 上传后用 file_id 引用)在 API易 不可用, 这是第三方中转平台的普遍情况。因此官方给 file_id 留的两个额度 —— 单图 64 MiB、单请求总量 200 MiB —— 也拿不到。实际能用的上限是:单图 ≤ 32 MiB、单请求体 ≤ 48 MiB。 超了会返回 image file size exceeds limit 32 MB

图片怎么计费

图片按缩放后的尺寸折成输入 tokens,与文本 tokens 一起按 $0.44 / 1M 计价。 下面是 API易 实测数据(用同一段提示词做差值,扣掉文本基线): 三条规律,实测与官方描述完全一致:
  • 单图上限 384 tokens。实测最大 354,怎么放大都超不过
  • 大图会被缩到约 800×800 等效。所以 2000² 与 4000² 折出的 tokens 完全相同, 上传前预压缩只省带宽、不省钱
  • 小于 384×384 的图会被放大。所以 64×64 和 384×384 花的钱一样, 小图不必刻意再缩

省下六成 token 的开关:detail: "low"

不需要看清细节时(判断图片类型、认主体、粗略分类),加上 detail: "low" 会把图缩到 512×512 再推理:
四个档位实测(1600×1200 同一张图):
detail 只在两个条件同时满足时生效:走 image_url 通道(放在 file 块上会被静默忽略), 且令牌是 default 分组ClaudeCode 分组下不生效)。填了非法值会明确报错:unknown variant 'ultra', expected one of 'low', 'high', 'original', 'auto'

深度思考控制

模型默认开启深度思考,思考内容会计入 max_tokens 配额。 纯识图任务建议直接关掉:实测关思考后 24/24 全对、更快,还省下思考的输出 tokens, 输入侧也少 80 tokens(思考模式的系统提示词固定占这么多)。 各写法实测(每种 3 次):
max_tokens 别给小。开着思考时,一句话问题也可能先输出几百 tokens 的思考内容, 给小了会 finish_reason: "length"content 为空字符串 —— 看起来像模型没回答。 开思考建议 2000 以上;或者干脆关掉思考。

上下文缓存

无需任何参数,相同长前缀重复请求会自动命中,命中部分按 $0.014 / 1M 计费。 但含图请求有两点和纯文本不一样 实测(2304 tokens 的文本前缀 + 一张 800×800 图): 命中量恰好等于图片之前那段文本,图片本身与其后的内容每次都全价。 所以把固定的长指令放在图片前面,能让它进缓存;放在图片后面则永远命中不了。
Anthropic 格式下这些字段叫 cache_read_input_tokens / cache_creation_input_tokens, 行为一致。注意 cache_control 显式缓存标记不生效(上游用的是自动前缀缓存), 且两种协议的 usage 口径不同:OpenAI 格式的 prompt_tokens 是全量, Anthropic 格式命中后 input_tokens 只剩未命中部分,不能直接对账

支持的图片格式

四种支持格式折出的 tokens 完全一致,选哪个都不影响成本。
格式按文件内容判断,不看你声明的 MIME。实测把 PNG 谎报成 image/jpeg 照样正常工作 —— 所以扩展名写错、MIME 填错都不影响,只要文件本身是这四种格式之一。

实测能力矩阵

以下为 API易 2026 年 8 月 21 日的实测结果:

视觉准确性抽查

限制与常见报错

上下文的 1,048,576 是实测硬上限,且报错显示 max_tokens 会计入这个总量… in the messages, … in the completion)。拼满长上下文时记得给输出配额留位置, 否则会撞上限。
其它常见 400:
  • You have uploaded an unsupported image —— 格式不在四种之列,或 base64 数据损坏
  • Failed to download image —— 外链不通或超过 60 秒
  • Image in assistant message is unsupported —— 图片只能放在 user 消息里
实测约 1%~3% 的请求会出现连接被静默关闭(客户端表现为 SSL EOF 或握手超时), 与图片无关、与分组无关,是通道层面的偶发现象。 客户端务必设置读超时并带重试,否则单条请求可能挂住两分钟以上。 超时设置见 超时配置

完整示例

OpenAI 格式(default 分组)

Anthropic 格式(ClaudeCode 分组)

相关文档

图像理解(识图)API

各家识图模型的通用调用方式与对比

DeepSeek V4 Flash 文本生成

同底座的纯文本版本,1M 上下文与双端点能力

分组怎么选

Codex、ClaudeCode 和 Default 三个分组的区别与选择建议

超时配置

客户端读超时与重试的推荐设置