Skip to main content
DeepSeek V4 Flash GA (deepseek-v4-flash-ga-260731)는 DeepSeek-V4-Flash-0731에 해당하며, 2026년 7월 31일 DeepSeek가 일반 공개로 전환한 오픈소스 체크포인트입니다. 아키텍처는 4월 프리뷰(총 284B / 활성화 13B MoE, 1M 컨텍스트)와 동일하며, DeepSeek는 사후 학습 단계만 다시 수행했다고 밝히지만 에이전트 벤치마크는 크게 개선되었습니다. APIYI는 21개의 테스트 케이스와 전용 듀얼 엔드포인트 재테스트를 완료했습니다. Chat Completions와 Responses는 모두 직접 호출할 수 있습니다.
APIYI가 DeepSeek V4 Flash GA를 출시했습니다: 모델 이름 deepseek-v4-flash-ga-260731, default / svip 그룹에서 사용할 수 있습니다. 이 모델은 기본적으로 추론을 많이 합니다 — 단순한 작업에는 thinking: {"type": "disabled"}를 명시적으로 전달하십시오(아래의 “추론 제어” 참조).

핵심 장점

잘 버티는 1M 컨텍스트

하드 입력 상한은 1,048,570 token입니다. 322K-token 숨은 바늘 찾기 테스트는 정확히 적중하여 14.77초 만에 반환되었으며, 최대 출력은 393,216 token입니다.

두 개의 캐싱 계층

암시적 캐시는 설정이 필요 없으며 두 번째 라운드에서 99.9%의 캐시 적중률을 보입니다. Responses는 이전 컨텍스트 전체를 적중하는 체인형 명시적 캐싱을 추가합니다.

스로틀링 없는 동시 실행

20개의 병렬 요청이 모두 200으로 반환되었으며, 실제 경과 시간은 단일 호출보다 1.3초만 더 걸렸습니다 — 고동시 실행 에이전트와 배치 텍스트 작업에 적합합니다.

매우 낮은 단가

$0.14 입력 / $0.28 출력, 1M tokens당이며 BytePlus의 정가와 같고, 캐시 적중은 $0.028까지 낮습니다.

모델 정보

측정된 기능 매트릭스

2026년 8월 5일에 APIYI에서 테스트한 결과입니다(공식 주장 vs 실제 동작):
공식 표와 일치하지 않는 기능이 3개 있습니다 — 통합 전에 반드시 알아두십시오: 구조화 출력은 두 엔드포인트 모두에서 조용히 실패합니다(스키마를 완전히 무시한 채 200을 반환합니다 — 강제가 필요할 때는 Function Call을 사용하십시오); 온라인 검색 도구는 연결되어 있지만 백엔드가 계속 오류를 반환하며 results를 반환하지 않습니다; MCP는 AccessDenied를 반환합니다 (모델 제한 사항이 아니라 계정 수준의 내장 도구 권한입니다).

추론 제어

이 모델은 기본적으로 많이 추론합니다 — 한 줄 질문인 “9.11이 9.9보다 큰가”는 우리 테스트에서 추론 token 263개를 사용했습니다(형제 deepseek-v4-flash은 44개만 사용했습니다). 간단한 작업에서는 명시적으로 비활성화하십시오:
reasoning_effort는 단조 증가형 사다리가 아닙니다. 두 질문 × 다섯 티어 × 다섯 샘플:high은 두 질문 모두에서 low보다 추론이 적었으며, 티어 내 분산 (low는 150에서 1993까지 분포함)이 티어 간 차이보다 훨씬 큽니다. 오직 minimal만 신뢰할 수 있습니다 — low → max를 비용 다이얼로 취급하지 마십시오.

캐싱

암시적 캐시(양쪽 엔드포인트에서 자동)

동일한 긴 prefix는 두 번째 요청에서 캐시 적중합니다. 15,634토큰 prefix가 15,616토큰(99.9%)과 일치했으며, 백만 tokens당 $0.028로 과금되었습니다.
암시적 캐시는 바이트 단위로 동일한 prefix가 필요합니다. 타임스탬프, 랜덤 ID, 사용자 이름처럼 변동 가능한 항목은 모두 prompt 끝에 두고, 절대 prefix에 섞지 마십시오.

명시적 캐시(Responses, 체인이 필요함)

흔한 실수: caching를 설정한 채 같은 긴 prefix를 두 번 다시 보내면 cached_tokens가 0으로 남습니다. 올바른 패턴은 첫 호출에서 기록한 다음, previous_response_id로 체인하는 것입니다:

빠른 시작

구조화된 출력이 필요하십니까? Function Call을 사용하십시오

response_format은 이 모델에서는 아무 효과도 없고 오류도 발생시키지 않으며, 가장 쉽게 빠질 수 있는 함정입니다. 실제로 제약되는 것은 도구 인자입니다:

가격

BytePlus 정가와 동일하며, 충전 프로모션과 함께 적용되어 실질 비용을 더 낮출 수 있습니다.
“주력 모델의 1/10 미만”에 대하여: 벤더의 마케팅은 V4-Pro의 프리뷰 시기 $1.74 / $3.48과 비교하고 있습니다. 현재 V4-Pro 정가($0.435 / $0.87)와 비교하면, 이 모델은 대략 1/3이며, 1/10은 아닙니다.

관련 페이지

채팅 완성

대화형 플레이그라운드가 포함된 OpenAI 호환 채팅 엔드포인트

응답

체인형 명시적 캐싱을 사용하는 응답 엔드포인트

출시 해설과 전체 테스트 데이터

벤치마크, 3자 속도 비교, 그리고 우리가 마주한 함정

모델 요금 표

모든 모델의 단가, 엔드포인트 및 그룹