gemini-3.5-flash-lite)는 2026년 7월에 업데이트된 Google의 경량 멀티모달 모델(안정판)로, 고빈도, 저지연, 저비용 워크로드를 위해 설계되었습니다. 이 모델은 텍스트/이미지/동영상/오디오/PDF 입력을 지원하며 1M 컨텍스트 윈도우와 64K 출력을 제공합니다. APIYI는 전체 이중 엔드포인트 테스트(25+5개 사례)를 완료했습니다. 네이티브 Gemini 형식과 OpenAI 호환 형식이 모두 별도 설정 없이 작동하며, 네이티브 도구인 Search grounding, URL 컨텍스트도 작동이 검증되었습니다.
현재 APIYI에서 사용 가능합니다: 모델명
gemini-3.5-flash-lite, default / svip 그룹에 있습니다. 3.6 Flash와 달리 — 기본적으로 추론 출력이 없습니다, 간단한 요청은 저희 테스트에서 약 2초 만에 반환되었습니다. 심층 추론을 명시적으로 활성화하려면 thinkingLevel: "high"를 전달하십시오.주요 내용
동급 최고 가성비
100만 token당 입력 $0.30 / 출력 $2.50(오디오 입력도 동일한 요율입니다) — 3.6 Flash의 5분의 1에서 3분의 1 수준입니다. 고빈도 및 배치 워크로드에 적합하게 설계되었습니다.
추론 없음, 지연 최소화
기본적으로 추론 token을 사용하지 않습니다. 간단한 요청은 ~2초로 측정되며(3.6 Flash에서는 ~4.5초), 지원 봇, 분류, 추출에 바로 사용할 수 있습니다.
완전한 멀티모달 이해
이미지, PDF, 오디오에서 정확성이 검증되었습니다(동영상은 동일한 파이프라인을 사용합니다). 주력 모델과 동일한 1M 컨텍스트를 제공합니다.
네이티브 도구 사용 가능
Google Search 연동, Maps 연동, URL 컨텍스트, 코드 실행이 네이티브 엔드포인트에서 작동함이 확인되었습니다 — Google API Key가 필요하지 않습니다.
모델 세부 정보
검증된 기능 매트릭스
2026년 7월 22일 APIYI 테스트 결과(공식 주장 대비 측정된 동작):요금
요금 참고: APIYI는 공식 요금을 그대로 적용합니다. 할인은 충전 보너스에서 발생하며, $100 충전 시 +10%, 최대 +20% (≈17% 할인)입니다. 충전 프로모션을 참조하십시오.
추론 제어
3.6 Flash의 반대입니다. 이 모델은 기본적으로 생각하지 않기 때문에 빠르고 저렴합니다. 측정 결과는 다음과 같습니다.빠른 시작
네이티브 Gemini 형식(권장 — 전체 도구 지원)
OpenAI 호환 형식(기존 코드에 바로 적용 가능)
자주 묻는 질문
Flash-Lite를 3.6 Flash보다 언제 선택해야 합니까?
Flash-Lite를 3.6 Flash보다 언제 선택해야 합니까?
처리량 우선 워크로드에는 Flash-Lite를 선택하십시오 — 고빈도 질의응답, 분류, 추출, 번역, 지원 봇에 적합합니다(약 2배 빠르고 비용은 5분의 1까지 내려갑니다). 심층 추론, 복잡한 계획, 또는 컴퓨터 사용에는 3.6 Flash를 선택하십시오.
네이티브 엔드포인트에 Google API 키가 필요합니까?
네이티브 엔드포인트에 Google API 키가 필요합니까?
아니요. APIYI token(
sk- 키)을 x-goog-api-key 헤더에 넣으십시오. 공식 google-genai SDK에서는 base_url를 https://api.apiyi.com로 설정하기만 하면 됩니다.추론 비용을 어떻게 모니터링합니까?
추론 비용을 어떻게 모니터링합니까?
네이티브 엔드포인트에서는
usageMetadata.thoughtsTokenCount를 확인하십시오. 참고로 OpenAI 호환 엔드포인트는 이 모델에 대해 reasoning_tokens를 보고하지 않으므로, 정확한 관찰에는 네이티브 엔드포인트를 사용하십시오.암시적 캐시가 적중합니까?
암시적 캐시가 적중합니까?
15.9K-token의 공유 접두사를 가진 연속된 세 요청에서 적중은 0건이었습니다(같은 조건에서 3.6 Flash는 한 번 적중했습니다). 캐시 적중을 바탕으로 비용 모델을 세우지 마십시오. 명시적 캐시 API는 아직 플랫폼에서 활성화되지 않았습니다.