跳到主要內容
2026-09-02 日報
開發生態

Google 於 Gemini API 推出代理式影片理解功能,最高減少 88% Token 消耗與 66% 成本

Google DeepMind一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Google DeepMind 宣布在 Gemini 3.7 Flash、3.6 Flash 及 3.5 Flash-Lite 模型推出代理式影片理解(agentic video understanding)功能。該功能已於 Google AI Studio 與 Gemini Enterprise Agent Platform 的 API 上線,開發者只需在 API 參數設定 `processing: "agentic"` 即可啟用,依標準 Token 計費,無額外功能費用。 有別於傳統以固定幀率(預設 1 FPS)讀取影片的靜態處理,代理式處理讓模型透過內部工具,主動決定觀看速度與模態(影像幀、音訊或逐字稿),動態搜尋並擷取所需片段。 根據官方基準測試,啟用該功能最高可減少 88% 的 Token 消耗與 66% 的分析成本,同時提升最高 7% 的準確率。此效率提升在 10 分鐘至數小時的長影片中尤為顯著,並解鎖了亞秒級片段檢索、長影片大海撈針搜尋、高幀率異常檢測及精確動作計數等應用。 官方表示,此功能近期將推送至 Gemini App 的所有 Flash 與 Flash-Lite 用戶,並於未來幾個月內驅動 YouTube 觀看頁面的「Ask YouTube」功能。
讀原始報導

背景

Google 先前於 2026 年 1 月在 Gemini 3 Flash 推出「Agentic Vision」功能,結合視覺推理與程式碼執行能力來處理影像。此次發布的代理式影片理解(Agentic video understanding)將此概念延伸至影片領域,讓模型能主動且動態地搜尋所需片段,取代過去固定幀率的靜態處理方式。

來源