gemini-3.6-flash)은 2026년 7월에 업데이트된 Google의 멀티모달 텍스트 모델입니다(정식 릴리스). text/image/video/audio/PDF 입력을 받아들이며, 1M 컨텍스트 윈도우와 64K 출력을 지원합니다. APIYI는 완전한 이중 엔드포인트 테스트 패스(26+5개 사례)를 완료했습니다. 네이티브 Gemini 형식과 OpenAI 호환 형식 모두 별도 설정 없이 바로 동작하며, 네이티브 도구인 Search grounding, code execution, URL context도 정상 동작이 검증되었습니다.
지금 APIYI에서 사용 가능: 모델명
gemini-3.6-flash, default / svip 그룹에 있습니다. 추론은 기본적으로 켜져 있습니다(thinking token은 output으로 과금됩니다) — 지연 시간이나 비용에 민감한 워크로드에서는 추론 단계를 낮추십시오(아래 “추론 제어” 참조). 경량 워크로드에는 더 저렴한 형제 모델 Gemini 3.5 Flash-Lite를 고려하십시오.하이라이트
완전한 네이티브 도구 모음
Google Search 그라운딩, Maps 그라운딩, URL 컨텍스트, 코드 실행, 그리고 Computer Use(미리보기)까지 모두 네이티브 엔드포인트에서 정상 작동이 검증되었으며, Google API Key는 필요하지 않습니다.
완전한 멀티모달 이해
이미지, PDF, 오디오 입력이 정확한 것으로 검증되었습니다(동영상은 동일한 파이프라인을 사용합니다). 1M 컨텍스트 윈도우에는 책 한 권이나 코드베이스 전체가 들어갑니다.
4단계 추론 수준
thinkingLevel minimal/low/medium/high는 0/403/487/837 추론 token으로 측정되며, 단조적이므로 작업별로 추론 예산을 정밀하게 책정할 수 있습니다.
두 개의 엔드포인트, 마찰 제로
네이티브 Gemini 형식(공식 SDK, base_url만 변경하면 됩니다)과 OpenAI 호환 형식이 있으며, 둘 다 공식 요금으로 제공됩니다.
모델 세부 정보
검증된 기능 매트릭스
2026년 7월 22일 APIYI 테스트 결과(공식 주장 대비 측정된 동작):가격
가격 참고: thinking tokens는 출력으로 과금되므로 추론 티어를 관리해야 하는 주된 이유입니다. APIYI는 공식 가격과 동일하며, 할인은 충전 보너스에서 나옵니다: $100에 +10%, 최대 +20%(약 17% 할인). 충전 프로모션을 참조하십시오.
추론 제어
추론은 기본적으로 켜져 있습니다: “1+1”도 먼저 약 200개의 thinking tokens를 생성합니다. 측정된 단계:빠른 시작
네이티브 Gemini 형식(권장 — 전체 도구 지원)
OpenAI 호환 형식(기존 코드에 바로 적용 가능)
자주 묻는 질문
네이티브 엔드포인트에 Google API Key가 필요합니까?
네이티브 엔드포인트에 Google API Key가 필요합니까?
아니요. APIYI token(
sk- key)을 x-goog-api-key 헤더에 넣으십시오. 공식 google-genai SDK에서는 base_url를 https://api.apiyi.com로 설정하기만 하면 됩니다.OpenAI 호환 엔드포인트에서 Search grounding / code execution이 작동합니까?
OpenAI 호환 엔드포인트에서 Search grounding / code execution이 작동합니까?
아니요. google_search, url_context, codeExecution, Maps grounding, Computer Use는 네이티브 형식에서만 지원됩니다. OpenAI 호환 엔드포인트는 표준 집합인 chat, streaming, 함수 호출, JSON Schema, 비전을 지원합니다.
암시적 캐싱으로 얼마나 절감됩니까?
암시적 캐싱으로 얼마나 절감됩니까?
반복되는 긴 접두사는 두 번째 요청에서 캐시 적중할 수 있습니다(측정값: 15.9K-token 접두사 중 8,176개)이지만, 적중은 확률적이므로 이를 바탕으로 비용 모델을 설계하지 마십시오. 명시적 cache API(cachedContents)는 아직 플랫폼에서 활성화되어 있지 않습니다.
Gemini 3.6 Flash 또는 3.5 Flash-Lite입니까?
Gemini 3.6 Flash 또는 3.5 Flash-Lite입니까?
도구, 깊은 사고, 더 강력한 추론에는 3.6 Flash를 선택하십시오. 빈도가 높고 지연 시간과 비용에 민감한 워크로드에는 3.5 Flash-Lite($0.30 in / $2.50 out, 기본적으로 추론을 사용하지 않으며, 대략 2배 빠름)를 선택하십시오.