deepseek-v4-flash-vision-exp은 DeepSeek의 실험적 비전 모델로, 이미지 입력이 추가된 V4 Flash 기반으로 구축되었습니다: 그림을 설명하고, 스크린샷의 텍스트를 읽고, 차트 값을 읽고, 여러 이미지를 비교할 수 있습니다. 텍스트 측의 모든 기능(1M 컨텍스트, 추론 모드, 함수 호출, 컨텍스트 캐싱)은 유지되며, 과금은 텍스트 전용 V4 Flash와 동일합니다 —— 비전에는 추가 요금이 없으며, 이미지는 크기에 따라 input tokens로 변환됩니다.
APIYI는 약 1,100회 호출에 걸쳐 124개의 테스트 케이스를 완료했으며, 세 가지 이미지 입력 채널, 네 가지 이미지 형식, 두 가지 프로토콜, 두 개의 그룹을 포함합니다.
하이라이트
비전 추가 요금 없음
텍스트 전용 V4 Flash와 동일한 가격입니다: $0.44 입력, 100만 token당 $1.32 출력입니다. 이미지는 입력 token이 되며, 이미지당 최대 384개로 제한됩니다.
테스트에서 인식 성능이 우수합니다
스크린샷 OCR 값이 모두 정확했고, 5개 막대 차트는 5/5로 읽혔으며, 36개 도형 중 특정 도형 세기기는 24/24였습니다. 부정 질문에서도 환각이 없었습니다.
사전 압축이 필요하지 않습니다
2000×2000과 4000×4000은 정확히 같은 token 수(346)로 변환됩니다. 업스트림이 대신 리사이즈해 주므로 —— 압축은 대역폭만 절약하고 비용은 절약하지 않습니다.
두 프로토콜 모두 작동합니다
OpenAI 형식(chat/completions + responses)과 Anthropic 형식(/v1/messages)은 둘 다 검증되었으며, 각각 자체 그룹을 통해 확인되었습니다.
모델 정보
Since 2026-08-17 the vendor bills this model in two tiers by time of day (peak hours are
01:00-04:00 and 06:00-10:00 (UTC)). APIYI charges the peak rate at all times, so your cost
never varies by the hour.
그룹 선택
APIYI의 두 그룹은 서로 다른 상위 엔드포인트로 라우팅되므로, 기능이 서로 동일하지 않습니다. 아래 표는 2026-08-21에 측정했으며, 각 칸마다 3회 반복한 결과입니다:OpenAI 형식 → default 그룹 사용
그룹 default으로 token을 생성한 다음:
Anthropic 형식 → ClaudeCode 그룹 사용
그룹 ClaudeCode으로 token을 생성한 다음:
이미지를 전송하는 세 가지 방법
1. 인라인 base64(가장 일반적)
2. 공개 이미지 URL
Failed to download image를 반환합니다.
3. file 콘텐츠 블록(인라인 base64와 동일)
image_url 채널과 동일합니다(같은 이미지에 대해 어느 방식이든 303입니다).
이미지 과금 방식
이미지는 리사이즈 후 치수를 기준으로 input tokens로 변환되며, 텍스트 tokens와 함께 $0.44 / 1M로 과금됩니다. 아래 수치는 APIYI에서 고정 prompt를 사용하고 텍스트만 기준값을 차감하여 측정한 것입니다:
공급업체 설명과 정확히 일치하는 세 가지 규칙은 다음과 같습니다:
- 이미지당 384 tokens는 절대 상한입니다. 측정된 최대값은 354였으며, 어떤 이미지도 이를 초과하지 않습니다
- 큰 이미지는 대략 800×800에 해당하도록 축소됩니다. 그래서 2000²와 4000²의 비용이 같으며, 업로드 전에 미리 압축하면 대역폭은 절약되지만 비용은 절약되지 않습니다
- 384×384보다 작은 이미지는 확대됩니다. 따라서 64×64의 비용은 384×384와 같으므로 —— 작은 이미지를 더 줄일 필요는 없습니다
token 절약 기능: detail: "low"
세부 사항이 중요하지 않을 때(이미지 유형 식별, 대상 인식, 대략적인 분류), 추론 전에 이미지를 512×512로 축소하도록 detail: "low"를 추가하십시오:
Controlling thinking mode
Thinking mode is on by default, and the thinking text counts against yourmax_tokens budget.
For pure image-reading tasks, turn it off: with thinking disabled our tests scored 24/24, ran
faster, saved the entire thinking output, and cut 80 input tokens as well (the thinking system
prompt costs exactly that much).
Every syntax, three runs each:
컨텍스트 캐싱
캐싱에는 매개변수가 필요 없습니다. 반복되는 긴 접두사는 자동으로 적중하며, 적중한 부분은 $0.014 / 1M으로 과금됩니다. 하지만 이미지가 포함된 요청은 텍스트 전용 요청과 두 가지 면에서 다릅니다:
2304-token 텍스트 접두사와 800×800 이미지 하나를 함께 사용해 측정한 결과:
적중은 이미지 앞에 있는 텍스트와 정확히 일치합니다. 이미지와 그 뒤의 모든 내용은 매번 전액으로 과금됩니다. 따라서 고정된 긴 지시문은 이미지 앞에 배치하여 캐시되게 하십시오 —— 이미지 뒤에 배치된 것은 절대 적중하지 않습니다.
Anthropic 형식에서는 이러한 필드의 이름이
cache_read_input_tokens와
cache_creation_input_tokens이며, 동작 방식도 같습니다. 명시적인 cache_control
마커는 효과가 없습니다(업스트림은 자동 접두사 캐싱을 사용합니다). 또한 두 프로토콜은 사용량을 다르게 보고합니다. OpenAI의 prompt_tokens는 항상 전체 수치인 반면, Anthropic의
input_tokens는 적중 후 캐시되지 않은 나머지로 줄어듭니다 —— 두 값은 직접적으로 일치시킬 수 없습니다.지원되는 이미지 형식
지원되는 네 가지 형식은 모두 동일한 token 수로 변환되므로, 컨테이너는 비용에 영향을 주지 않습니다.
검증된 기능 매트릭스
APIYI가 2026-08-21에 측정했습니다:정확도 부분 검증
제한 및 일반적인 오류
1,048,576 컨텍스트 상한은 측정 대상이며, 오류 메시지에는
max_tokens이 같은 총량에 포함된다고 표시됩니다 (… in the messages, … in the completion). 긴
컨텍스트를 채울 때는 출력 예산을 위한 여유를 남겨 두지 않으면 상한에 도달합니다.You have uploaded an unsupported image—— 형식이 네 가지 중 하나가 아니거나 base64가 손상되었습니다Failed to download image—— URL에 연결할 수 없거나 60초 넘게 소요되었습니다Image in assistant message is unsupported—— 이미지는user메시지에만 나타날 수 있습니다
테스트에서는 요청의 약 **1%-3%**에서 연결이 조용히 종료되었습니다(클라이언트에는 SSL EOF 또는 핸드셰이크 타임아웃으로 나타났습니다). 이는 이미지와도 무관하고
그룹과도 무관합니다 —— 가끔 발생하는 전송 계층 수준의 이벤트입니다. 반드시 읽기 타임아웃을 설정하고 재시도하십시오,
그렇지 않으면 단일 요청이 2분 넘게 멈춰 있을 수 있습니다.
타임아웃 설정을 참조하십시오.
전체 예시
OpenAI 형식 (default 그룹)
Anthropic 형식 (ClaudeCode 그룹)
관련 문서
비전 이해 API
비전 모델 전반의 일반적인 호출 패턴과 비교
DeepSeek V4 Flash
같은 기반의 텍스트 전용 형제 모델로, 1M 컨텍스트와 이중 엔드포인트를 지원합니다
그룹 선택
Codex, ClaudeCode 및 Default 그룹의 차이와 어떤 그룹을 선택할지
타임아웃 설정
권장 클라이언트 읽기 타임아웃 및 재시도 설정