Skip to main content
Gemini 3.6 Flash (gemini-3.6-flash)은 2026년 7월에 업데이트된 Google의 멀티모달 텍스트 모델입니다(정식 릴리스). text/image/video/audio/PDF 입력을 받아들이며, 1M 컨텍스트 윈도우와 64K 출력을 지원합니다. APIYI는 완전한 이중 엔드포인트 테스트 패스(26+5개 사례)를 완료했습니다. 네이티브 Gemini 형식과 OpenAI 호환 형식 모두 별도 설정 없이 바로 동작하며, 네이티브 도구인 Search grounding, code execution, URL context도 정상 동작이 검증되었습니다.
지금 APIYI에서 사용 가능: 모델명 gemini-3.6-flash, default / svip 그룹에 있습니다. 추론은 기본적으로 켜져 있습니다(thinking token은 output으로 과금됩니다) — 지연 시간이나 비용에 민감한 워크로드에서는 추론 단계를 낮추십시오(아래 “추론 제어” 참조). 경량 워크로드에는 더 저렴한 형제 모델 Gemini 3.5 Flash-Lite를 고려하십시오.

하이라이트

완전한 네이티브 도구 모음

Google Search 그라운딩, Maps 그라운딩, URL 컨텍스트, 코드 실행, 그리고 Computer Use(미리보기)까지 모두 네이티브 엔드포인트에서 정상 작동이 검증되었으며, Google API Key는 필요하지 않습니다.

완전한 멀티모달 이해

이미지, PDF, 오디오 입력이 정확한 것으로 검증되었습니다(동영상은 동일한 파이프라인을 사용합니다). 1M 컨텍스트 윈도우에는 책 한 권이나 코드베이스 전체가 들어갑니다.

4단계 추론 수준

thinkingLevel minimal/low/medium/high는 0/403/487/837 추론 token으로 측정되며, 단조적이므로 작업별로 추론 예산을 정밀하게 책정할 수 있습니다.

두 개의 엔드포인트, 마찰 제로

네이티브 Gemini 형식(공식 SDK, base_url만 변경하면 됩니다)과 OpenAI 호환 형식이 있으며, 둘 다 공식 요금으로 제공됩니다.

모델 세부 정보

검증된 기능 매트릭스

2026년 7월 22일 APIYI 테스트 결과(공식 주장 대비 측정된 동작):
코드 실행 참고 사항: 테스트 결과 코드는 실제로 상위에서 실행됨을 확인했습니다(암기 불가능한 sha256 작업이 올바른 다이제스트를 반환함). তবে executableCode / codeExecutionResult 부분은 현재 응답에 그대로 반영되지 않으며, 코드와 그 결과는 대신 텍스트 본문에 나타납니다. 이 두 필드를 별도로 렌더링하는 앱은 유의해야 합니다.

가격

가격 참고: thinking tokens는 출력으로 과금되므로 추론 티어를 관리해야 하는 주된 이유입니다. APIYI는 공식 가격과 동일하며, 할인은 충전 보너스에서 나옵니다: $100에 +10%, 최대 +20%(약 17% 할인). 충전 프로모션을 참조하십시오.

추론 제어

추론은 기본적으로 켜져 있습니다: “1+1”도 먼저 약 200개의 thinking tokens를 생성합니다. 측정된 단계:
thinkingConfig: {"includeThoughts": true}를 전달하면 생각 부분을 다시 받을 수 있습니다(thought: true로 표시됨); 사용량은 usageMetadata.thoughtsTokenCount에 표시됩니다. OpenAI 호환 엔드포인트에서는 reasoning_effort(낮음/중간/높음)를 사용하고 usage.completion_tokens_details.reasoning_tokens을 확인하십시오.

빠른 시작

네이티브 Gemini 형식(권장 — 전체 도구 지원)

OpenAI 호환 형식(기존 코드에 바로 적용 가능)

자주 묻는 질문

아니요. APIYI token(sk- key)을 x-goog-api-key 헤더에 넣으십시오. 공식 google-genai SDK에서는 base_urlhttps://api.apiyi.com로 설정하기만 하면 됩니다.
아니요. google_search, url_context, codeExecution, Maps grounding, Computer Use는 네이티브 형식에서만 지원됩니다. OpenAI 호환 엔드포인트는 표준 집합인 chat, streaming, 함수 호출, JSON Schema, 비전을 지원합니다.
반복되는 긴 접두사는 두 번째 요청에서 캐시 적중할 수 있습니다(측정값: 15.9K-token 접두사 중 8,176개)이지만, 적중은 확률적이므로 이를 바탕으로 비용 모델을 설계하지 마십시오. 명시적 cache API(cachedContents)는 아직 플랫폼에서 활성화되어 있지 않습니다.
도구, 깊은 사고, 더 강력한 추론에는 3.6 Flash를 선택하십시오. 빈도가 높고 지연 시간과 비용에 민감한 워크로드에는 3.5 Flash-Lite($0.30 in / $2.50 out, 기본적으로 추론을 사용하지 않으며, 대략 2배 빠름)를 선택하십시오.

관련