Skip to main content
deepseek-v4-flash-vision-exp은 DeepSeek의 실험적 비전 모델로, 이미지 입력이 추가된 V4 Flash 기반으로 구축되었습니다: 그림을 설명하고, 스크린샷의 텍스트를 읽고, 차트 값을 읽고, 여러 이미지를 비교할 수 있습니다. 텍스트 측의 모든 기능(1M 컨텍스트, 추론 모드, 함수 호출, 컨텍스트 캐싱)은 유지되며, 과금은 텍스트 전용 V4 Flash와 동일합니다 —— 비전에는 추가 요금이 없으며, 이미지는 크기에 따라 input tokens로 변환됩니다. APIYI는 약 1,100회 호출에 걸쳐 124개의 테스트 케이스를 완료했으며, 세 가지 이미지 입력 채널, 네 가지 이미지 형식, 두 가지 프로토콜, 두 개의 그룹을 포함합니다.
호출하기 전에 먼저 읽으십시오: 이 모델은 APIYI에서 기능이 다른 두 그룹으로 제공됩니다. 사용하는 프로토콜에 맞는 그룹을 선택하십시오.잘못된 그룹을 선택해도 “잘못된 그룹” 오류가 발생하지 않습니다. 대신 매개변수가 조용히 아무 동작도 하지 않거나, 두 번째 턴에서 400 오류가 나거나, /v1/responsesmessages를 문제 삼는 형태로 나타납니다. 두 그룹의 과금은 동일합니다 —— 그룹은 기능에만 영향을 미치며, 과금에는 영향을 주지 않습니다. 아래의 “그룹 선택”을 참조하십시오.

하이라이트

비전 추가 요금 없음

텍스트 전용 V4 Flash와 동일한 가격입니다: $0.44 입력, 100만 token당 $1.32 출력입니다. 이미지는 입력 token이 되며, 이미지당 최대 384개로 제한됩니다.

테스트에서 인식 성능이 우수합니다

스크린샷 OCR 값이 모두 정확했고, 5개 막대 차트는 5/5로 읽혔으며, 36개 도형 중 특정 도형 세기기는 24/24였습니다. 부정 질문에서도 환각이 없었습니다.

사전 압축이 필요하지 않습니다

2000×2000과 4000×4000은 정확히 같은 token 수(346)로 변환됩니다. 업스트림이 대신 리사이즈해 주므로 —— 압축은 대역폭만 절약하고 비용은 절약하지 않습니다.

두 프로토콜 모두 작동합니다

OpenAI 형식(chat/completions + responses)과 Anthropic 형식(/v1/messages)은 둘 다 검증되었으며, 각각 자체 그룹을 통해 확인되었습니다.

모델 정보

Since 2026-08-17 the vendor bills this model in two tiers by time of day (peak hours are 01:00-04:00 and 06:00-10:00 (UTC)). APIYI charges the peak rate at all times, so your cost never varies by the hour.

그룹 선택

APIYI의 두 그룹은 서로 다른 상위 엔드포인트로 라우팅되므로, 기능이 서로 동일하지 않습니다. 아래 표는 2026-08-21에 측정했으며, 각 칸마다 3회 반복한 결과입니다:

OpenAI 형식 → default 그룹 사용

그룹 default으로 token을 생성한 다음:

Anthropic 형식 → ClaudeCode 그룹 사용

그룹 ClaudeCode으로 token을 생성한 다음:
하나의 계정에는 서로 다른 그룹의 token을 여러 개 동시에 둘 수 있으며 서로 간섭하지 않습니다 —— 프로토콜마다 하나씩 두는 구성이 권장됩니다. 다음을 참고하십시오 그룹이란 무엇입니까token과 그룹에서 생성 방법을 확인하고, Codex vs ClaudeCode vs 기본 그룹에서 세 그룹의 차이를 확인하십시오.
Anthropic 형식에서는 default 그룹을 절대 사용하지 마십시오. 여기서는 두 가지 문제가 겹칩니다:
  1. top_p를 생략하면 매번 400 Invalid top_p value가 반환됩니다
  2. top_p가 제공되어도, 첫 턴의 thinking 블록을 두 번째 턴에 다시 넣으면 unknown variant 'thinking'가 반환됩니다 —— 그리고 Claude Code와 Anthropic SDK 같은 표준 클라이언트는 항상 이를 다시 전송하므로 멀티턴은 항상 깨집니다
ClaudeCode 그룹으로 바꾸면 두 문제 모두 없으며, 전체 도구 호출 왕복도 정상 작동합니다.

이미지를 전송하는 세 가지 방법

1. 인라인 base64(가장 일반적)

2. 공개 이미지 URL

URL은 최대 8192자까지 가능하며 다운로드는 60초 이내에 완료되어야 합니다. 끊어진 링크는 Failed to download image를 반환합니다.

3. file 콘텐츠 블록(인라인 base64와 동일)

측정된 token 비용은 image_url 채널과 동일합니다(같은 이미지에 대해 어느 방식이든 303입니다).
Files API(/v1/files에 업로드한 뒤 file_id로 참조)는 APIYI에서 사용할 수 없습니다, 이는 서드파티 게이트웨이에서 일반적인 방식입니다. 공급업체가 file_id에 대해 예약해 둔 두 가지 허용치 —— 이미지당 64 MiB와 요청당 200 MiB —— 는 따라서 이용할 수 없습니다.실제로 적용되는 제한은 이미지당 32 MiB 및 요청 본문당 48 MiB입니다. 이를 초과하면 image file size exceeds limit 32 MB를 반환합니다.

이미지 과금 방식

이미지는 리사이즈 후 치수를 기준으로 input tokens로 변환되며, 텍스트 tokens와 함께 $0.44 / 1M로 과금됩니다. 아래 수치는 APIYI에서 고정 prompt를 사용하고 텍스트만 기준값을 차감하여 측정한 것입니다: 공급업체 설명과 정확히 일치하는 세 가지 규칙은 다음과 같습니다:
  • 이미지당 384 tokens는 절대 상한입니다. 측정된 최대값은 354였으며, 어떤 이미지도 이를 초과하지 않습니다
  • 큰 이미지는 대략 800×800에 해당하도록 축소됩니다. 그래서 2000²와 4000²의 비용이 같으며, 업로드 전에 미리 압축하면 대역폭은 절약되지만 비용은 절약되지 않습니다
  • 384×384보다 작은 이미지는 확대됩니다. 따라서 64×64의 비용은 384×384와 같으므로 —— 작은 이미지를 더 줄일 필요는 없습니다

token 절약 기능: detail: "low"

세부 사항이 중요하지 않을 때(이미지 유형 식별, 대상 인식, 대략적인 분류), 추론 전에 이미지를 512×512로 축소하도록 detail: "low"를 추가하십시오:
같은 1600×1200 이미지로 측정한 4개 수준은 다음과 같습니다:
detail 조건이 모두 충족될 때만 적용됩니다. 즉, image_url 블록에 설정되어 있어야 하며 (file 블록에서는 조용히 무시됩니다), 그리고 token이 default 그룹에 속해 있어야 합니다 (ClaudeCode 그룹에서는 아무 동작도 하지 않습니다).유효하지 않은 값은 오류를 발생시킵니다: unknown variant 'ultra', expected one of 'low', 'high', 'original', 'auto'.

Controlling thinking mode

Thinking mode is on by default, and the thinking text counts against your max_tokens budget. For pure image-reading tasks, turn it off: with thinking disabled our tests scored 24/24, ran faster, saved the entire thinking output, and cut 80 input tokens as well (the thinking system prompt costs exactly that much). Every syntax, three runs each:
Do not set max_tokens too low. With thinking on, even a one-line question can emit several hundred tokens of thinking first; too small a budget yields finish_reason: "length" with an empty content —— which looks like the model failed to answer. Use 2000 or more with thinking on, or simply disable thinking.

컨텍스트 캐싱

캐싱에는 매개변수가 필요 없습니다. 반복되는 긴 접두사는 자동으로 적중하며, 적중한 부분은 $0.014 / 1M으로 과금됩니다. 하지만 이미지가 포함된 요청은 텍스트 전용 요청과 두 가지 면에서 다릅니다: 2304-token 텍스트 접두사와 800×800 이미지 하나를 함께 사용해 측정한 결과: 적중은 이미지 앞에 있는 텍스트와 정확히 일치합니다. 이미지와 그 뒤의 모든 내용은 매번 전액으로 과금됩니다. 따라서 고정된 긴 지시문은 이미지 앞에 배치하여 캐시되게 하십시오 —— 이미지 뒤에 배치된 것은 절대 적중하지 않습니다.
Anthropic 형식에서는 이러한 필드의 이름이 cache_read_input_tokenscache_creation_input_tokens이며, 동작 방식도 같습니다. 명시적인 cache_control 마커는 효과가 없습니다(업스트림은 자동 접두사 캐싱을 사용합니다). 또한 두 프로토콜은 사용량을 다르게 보고합니다. OpenAI의 prompt_tokens는 항상 전체 수치인 반면, Anthropic의 input_tokens는 적중 후 캐시되지 않은 나머지로 줄어듭니다 —— 두 값은 직접적으로 일치시킬 수 없습니다.

지원되는 이미지 형식

지원되는 네 가지 형식은 모두 동일한 token 수로 변환되므로, 컨테이너는 비용에 영향을 주지 않습니다.
형식은 사용자가 선언한 MIME 타입이 아니라 파일 내용에서 감지됩니다. 테스트에서는 image/jpeg로 선언된 PNG도 문제없이 동작했습니다 —— 잘못된 확장자나 잘못된 MIME은 파일 자체가 네 가지 지원 형식 중 하나이기만 하면 상관없습니다.

검증된 기능 매트릭스

APIYI가 2026-08-21에 측정했습니다:

정확도 부분 검증

제한 및 일반적인 오류

1,048,576 컨텍스트 상한은 측정 대상이며, 오류 메시지에는 max_tokens이 같은 총량에 포함된다고 표시됩니다 (… in the messages, … in the completion). 긴 컨텍스트를 채울 때는 출력 예산을 위한 여유를 남겨 두지 않으면 상한에 도달합니다.
기타 흔한 400 오류:
  • You have uploaded an unsupported image —— 형식이 네 가지 중 하나가 아니거나 base64가 손상되었습니다
  • Failed to download image —— URL에 연결할 수 없거나 60초 넘게 소요되었습니다
  • Image in assistant message is unsupported —— 이미지는 user 메시지에만 나타날 수 있습니다
테스트에서는 요청의 약 **1%-3%**에서 연결이 조용히 종료되었습니다(클라이언트에는 SSL EOF 또는 핸드셰이크 타임아웃으로 나타났습니다). 이는 이미지와도 무관하고 그룹과도 무관합니다 —— 가끔 발생하는 전송 계층 수준의 이벤트입니다. 반드시 읽기 타임아웃을 설정하고 재시도하십시오, 그렇지 않으면 단일 요청이 2분 넘게 멈춰 있을 수 있습니다. 타임아웃 설정을 참조하십시오.

전체 예시

OpenAI 형식 (default 그룹)

Anthropic 형식 (ClaudeCode 그룹)

관련 문서

비전 이해 API

비전 모델 전반의 일반적인 호출 패턴과 비교

DeepSeek V4 Flash

같은 기반의 텍스트 전용 형제 모델로, 1M 컨텍스트와 이중 엔드포인트를 지원합니다

그룹 선택

Codex, ClaudeCode 및 Default 그룹의 차이와 어떤 그룹을 선택할지

타임아웃 설정

권장 클라이언트 읽기 타임아웃 및 재시도 설정