先看這一條:影片只能通過 Base64 內聯(整個請求 ≤ 20MB) 或 YouTube 連結(Gemini 原生格式)傳入。直接傳公開影片直鏈(如
https://example.com/demo.mp4)會報 Request contains an invalid argument —— 這是谷歌不接收直鏈,並非 API易 攔截。詳見下方「影片輸入方式」。視覺化介面測試
在 iCover 視覺化測試工具裡直接上傳影片、除錯理解介面。
支援的模型
經典穩定版
gemini-2.5-pro(2M 上下文)與 gemini-2.5-flash 仍可用。完整價格見 模型列表與價格。
影片輸入方式
這是最容易踩坑的地方,請先對照下表確認你的輸入方式是否被支援:快速開始:Base64 內聯(OpenAI 相容格式)
最常用的方式:讀取本地影片 → base64 編碼 → 用image_url 欄位傳入。
<BASE64_VIDEO> 替換為影片的 base64 字串;體積較大時建議直接用 SDK 自動編碼):
YouTube 連結(Gemini 原生格式)
YouTube 連結無需下載、不受 20MB 限制,但只能通過 Gemini 原生格式傳入(google-genai SDK,端點 https://api.apiyi.com)。
原生格式的更多用法(流式、推理預算、Function Calling 等)見 Gemini 原生格式呼叫。
進階技巧
時間戳定位
模型預設按 1 幀/秒取樣並理解音訊,你可以在提示詞裡用MM:SS 直接定位片段——這是純提示詞技巧,任意輸入方式都可用:
常見任務的提問思路
同一段影片,換提示詞就能完成不同分析,無需改程式碼:- 內容摘要:用 3-5 句話概括影片主題、關鍵畫面與結論
- 教學分析:提取知識點、章節劃分與重點時間戳
- 監控分析:識別異常行為、出現的人/物及發生時間
- 營銷評估:分析產品賣點呈現、節奏與目標受眾契合度
- 動作分析:拆解動作步驟、姿態要點與可改進之處
技術說明
- 取樣幀率:預設按 1 幀/秒(FPS) 取樣,同時理解音訊軌。
- Token 消耗:預設解析度約 300 tokens/秒,低解析度約 100 tokens/秒——影片越長,token 越多,請據此估算成本。
- 支援格式:mp4、mpeg、mov(quicktime)、avi、webm、wmv、3gpp 等常見格式。
常見問題
傳公開影片連結報錯 Request contains an invalid argument / 拉取失敗
傳公開影片連結報錯 Request contains an invalid argument / 拉取失敗
谷歌的影片理解不接收任意公開直鏈(如
https://example.com/video.mp4),會返回 Request contains an invalid argument。這不是 API易 或 Nginx 攔截。請改用:① Base64 內聯(≤20MB);② YouTube 連結(原生格式)。為什麼限制 20MB?之前明明能用
為什麼限制 20MB?之前明明能用
Base64 內聯方式下,整個請求體一直限制在 20MB 以內(與谷歌官方一致)。如果你”之前能用”的是公開直鏈,那其實從來不是受支援的方式,只是恰好某些情況下沒報錯;現在按規範會明確拒絕。
能用 files.upload 上傳大影片嗎?
能用 files.upload 上傳大影片嗎?
不能。Gemini 官方的 Files API(
client.files.upload())第三方不支援,僅谷歌官方端點可用。大影片請走 YouTube 連結,或壓縮到 20MB 內用 Base64。超過 20MB 的影片怎麼辦?
超過 20MB 的影片怎麼辦?
兩條路:① 上傳到 YouTube 後用連結傳入(原生格式,不受 20MB 限制);② 用 ffmpeg 等工具本地壓縮或擷取關鍵片段到 20MB 內再 base64。
相關資源
模型列表與價格
檢視全部 Gemini 模型與最新定價
Gemini 原生格式
YouTube 連結、流式、推理預算等原生用法
影像理解 API
圖片內容識別與多模態分析
API 文件
完整 API 規範與端點說明