Skip to main content
Gemini 3.6 Flash(gemini-3.6-flash)是谷歌 2026 年 7 月更新的多模態文本模型(stable 版),支援文本/影像/影片/音訊/PDF 輸入,1M 上下文、64K 輸出。API易已完成雙端點全量實測(26+5 用例),Gemini 原生格式與 OpenAI 相容格式均可直接呼叫,搜尋 grounding、程式碼執行、URL context 等原生工具實測可用。
API易已接入 Gemini 3.6 Flash:模型名 gemini-3.6-flashdefault / svip 分組可用。預設開啟深度思考(思考 tokens 計入輸出計費),對延遲和成本敏感的場景請調低思考檔位(詳見下方「思考控制」)。輕量場景可考慮半價姊妹款 Gemini 3.5 Flash-Lite

核心優勢

原生工具全家桶

Google 搜尋 grounding、Maps grounding、URL context、程式碼執行、Computer Use(Preview)在原生端點全部實測放通,無需 Google API Key。

全模態理解

影像、PDF、音訊實測識別準確(影片同管線支援),1M 上下文可塞整本書或整個程式碼庫。

思考四檔可控

thinkingLevel minimal/low/medium/high 實測思考量 0/403/487/837 tokens 單調遞增,按任務精確控制思考成本。

雙端點無縫接入

Gemini 原生格式(官方 SDK 直連)與 OpenAI 相容格式(改 base_url 即用)同時開通,與官網同價。

模型資訊

實測能力矩陣

以下為 API易 2026 年 7 月 22 日的實測結果(官方能力宣告 vs 實際表現):
程式碼執行說明:實測程式碼在上游真實執行(不可心算的 sha256 題答案正確),但響應中 executableCode / codeExecutionResult 欄位暫不回顯,程式碼與執行結果會在正文文本中呈現。依賴這兩個欄位做介面分離展示的應用請注意。

定價

價格說明:思考 tokens 按輸出計費——這是控制思考檔位最直接的理由。API易與官網同價,折扣體現在充值加贈:充 $100 送 10%、最高送 20%(≈83 折),詳見 充值優惠

思考控制

預設開啟深度思考:一句 1+1 也會先產生約 200 思考 tokens。實測四檔:
需要檢視思考過程時傳 thinkingConfig: {"includeThoughts": true},響應中會返回帶 thought: true 標記的思考 part,用量看 usageMetadata.thoughtsTokenCount。OpenAI 相容端用 reasoning_effort(low/medium/high)分檔,消耗看 usage.completion_tokens_details.reasoning_tokens

呼叫示例

Gemini 原生格式(推薦,工具全支援)

OpenAI 相容格式(存量程式碼零改造)

常見問題

不需要。API易令牌(sk- 開頭)直接放在 x-goog-api-key 請求頭即可,官方 google-genai SDK 只需把 base_url 改為 https://api.apiyi.com
不能。google_search、url_context、codeExecution、Maps grounding、Computer Use 等原生工具僅 Gemini 原生格式支援,OpenAI 相容端覆蓋常規能力(對話/流式/FC/JSON Schema/視覺)。
相同長字首第二次請求可能命中(實測 15.9K tokens 字首命中 8,176 tokens),但命中為機率行為,請勿按穩定命中做成本測算。顯式快取 API(cachedContents)平臺暫未開通。
要工具、要深度思考、要更強推理選 3.6 Flash;高頻、低延遲、成本敏感選 3.5 Flash-Lite(輸入 $0.30/輸出 $2.50,預設不思考、響應約快一倍)。

相關文件