gemini-3.8-flash)는 Google이 2026년 9월 2일 출시한 멀티모달 텍스트 모델로, 텍스트, 이미지, 동영상 및 오디오 입력을 지원합니다. APIYI는 Gemini 네이티브 및 OpenAI 호환 엔드포인트를 모두 제공하며, 출시 전에 gemini-3.7-flash를 기준으로 두 프로토콜에 걸쳐 150개의 쌍으로 구성된 테스트 케이스를 실행했습니다.
Gemini 3.8 Flash를 APIYI에서 사용할 수 있습니다: 모델 이름은
gemini-3.8-flash이며, default 및 svip 그룹에서 사용할 수 있습니다. 심층 사고가 기본적으로 활성화되어 있으며 사고 token은 출력으로 과금되므로, 지연 시간 및 비용에 민감한 경로에서는 사고 단계를 낮추거나 끄시기 바랍니다(아래의 “사고 제어” 참조).차별화되는 점
3.6 Flash의 절반 가격
1M tokens당 입력 $0.75 / 출력 $3.75 — 3.6 Flash($1.50 / $7.50)의 절반이며, 3.7 Flash와 줄 단위로 동일하므로 3.7에서 마이그레이션하는 데 비용이 들지 않습니다.
출시 전 테스트 사례 150개
두 프로토콜 모두에서 3.7 Flash를 대상으로 동시에 실행했습니다. 핵심 기능, 추론, 병렬 도구 호출, 이미지/동영상 이해가 모두 일치하며 3.8에만 해당하는 회귀는 없습니다.
두 엔드포인트 모두 마찰 없이 사용 가능
Gemini 네이티브 형식(공식 SDK, Google API 키 불필요)과 OpenAI 호환 형식(base_url만 변경)은 모두 사용할 수 있습니다.
거의 제로에 가까운 마이그레이션 비용
3.7 Flash에서 모델 이름을 한 줄만 변경하면 됩니다. 요청 형식, 매개변수, 응답 필드는 변경되지 않으며, 필드 집합 차이 하나와 측정된 타입 변경 0건만 존재합니다.
모델 정보
측정된 기능 매트릭스
2026년 9월 2일 APIYI 테스트 결과 — 150개 사례 로그와 198회의 호출을 포함하며, 시간대의 영향을 배제하기 위해 모든 사례를gemini-3.7-flash에 동시에 실행했습니다.
가격
gemini-3.7-flash와 한 줄 한 줄 동일하므로, 3.7에서 마이그레이션해도 비용에는 아무런 변화가 없습니다. 3.6 Flash($1.50 / $7.50)과 비교하면 정확히 절반입니다.
가격 관련 안내: 추론 token은 출력으로 과금됩니다. 이것이 추론 등급을 관리해야 하는 가장 직접적인 이유입니다. Google은 3.8 Flash의 공식 가격을 발표하지 않았습니다. 참고로 현재 3.7 Flash에 적용 중인 $0.75 / $3.75는 Google 자체의 기간 한정 프로모션 요율이며, 2026년 12월 31일까지 유효하다고 명시되어 있습니다. APIYI 가격은 제공업체의 가격과 한 줄 한 줄 일치하며, 할인은 충전 보너스를 통해 적용됩니다. 자세한 내용은 충전 프로모션을 참조하십시오.
사고 제어
심층 사고는 기본적으로 활성화되어 있습니다: “1+1” 프롬프트도 먼저 수백 개의 사고 token을 소모합니다. 세 가지 계층에서 동일한 질문과 네이티브 엔드포인트를 사용해 측정한 결과입니다.예시
Gemini 고유 형식 (권장, 더 폭넓은 tools 지원)
OpenAI 호환 형식 (기존 코드 변경 없음)
마이그레이션 가이드
gemini-3.7-flash에서 마이그레이션하는 경우
gemini-3.7-flash에서 마이그레이션하는 경우
모델 이름만 변경하면 됩니다. 요청 형식, 매개변수 및 응답 필드는 변경 없이 테스트되었으며, 한 그룹에서 응답 필드 집합만 다르고 타입 변경은 없으므로 클라이언트를 조정할 필요가 없습니다. 과금은 동일하므로 기존 예산을 그대로 사용할 수 있습니다.
gemini-3.6-flash에서 마이그레이션하는 경우
gemini-3.6-flash에서 마이그레이션하는 경우
가격이 절반으로 인하되지만(입력 $1.50 → $0.75, 출력 $7.50 → $3.75), 한 가지를 변경해야 합니다.
thinkingLevel: "minimal"은 더 이상 지원되지 않으며 네이티브 엔드포인트에서 400을 반환하므로 thinkingConfig: {"thinkingBudget": 0}로 전환해야 합니다. OpenAI 호환 엔드포인트에서는 reasoning_effort: "minimal"에 오류가 발생하지 않지만 자동으로 무시되며 추론에 대한 과금은 계속되므로 이 부분도 수정해야 합니다.컨텍스트 한도는 얼마입니까?
컨텍스트 한도는 얼마입니까?
Google은 이를 공개하지 않았으며, 3.7의 수치로 추론하지도 않을 것입니다. 14.5K자의 접두사가 포함된 긴 컨텍스트 조회 작업은 테스트를 통과했습니다. 긴 컨텍스트에 크게 의존한다면 먼저 트래픽의 일부에서 점진적으로 적용하고, 한도를 확인한 다음 전환하십시오. 공식 사양이 발표되면 이 페이지를 업데이트하겠습니다.
네이티브 엔드포인트에 Google API 키가 필요합니까?
네이티브 엔드포인트에 Google API 키가 필요합니까?
아닙니다.
sk-로 시작하는 APIYI 키를 x-goog-api-key 헤더에 직접 입력하십시오. 공식 google-genai SDK를 사용하는 경우에는 base_url가 https://api.apiyi.com를 가리키도록 설정하십시오.네이티브 전용 기능은 무엇입니까?
네이티브 전용 기능은 무엇입니까?
코드 실행, URL 컨텍스트,
safetySettings, 그리고 stopSequences 및 seed의 엄격한 처리는 Gemini 네이티브 엔드포인트에서만 사용할 수 있습니다. OpenAI 호환 엔드포인트는 일반적인 기능 범위(채팅 / 스트리밍 / 함수 호출 / JSON 스키마 / 비전)를 지원하지만, stop 및 seed은 해당 엔드포인트에서 효과가 없는 것으로 테스트되었습니다.