📰 重點摘要
Gemini 今日宣布為旗下 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite 三款模型推出「代理式影片理解」(agentic video understanding)新能力,透過 Gemini API(Google AI Studio 及 Gemini Enterprise Agent Platform)即可對上傳影片與 YouTube 影片使用,同時支援上傳影片與 YouTube 連結兩種來源。
與過去「靜態」處理方式(模型以固定影格率、預設每秒1幀、可透過API調整取樣影片)不同,代理式影片理解讓模型能主動、目標導向地決定要看哪一段、用什麼速度、透過哪種模態(影格、音訊或文字稿),只抓取真正需要的片段與訊號,並透過內部工具呼叫動態搜尋、掃描、檢視目標片段。這概念類似先前的「代理式視覺」(結合程式執行與原生圖像理解),現在則延伸到影片的原生工具整合。
官方在標準影片分析基準測試中指出,啟用此功能後分析成本最高可降低66%,token消耗最高減少88%,準確率最高提升7%;其中效益在長影片(10分鐘教學影片到90分鐘講座、多小時錄影)上特別明顯,因為靜態處理常迫使開發者在高token成本與犧牲關鍵細節之間二選一。三款模型皆有提升,其中Gemini 3.7 Flash搭配此功能後,在準確率與成本效益的權衡上達到帕累托前緣(pareto frontier),即整體品質最佳且性價比最優。
應用場景包括次秒級(sub-second)時刻檢索、精確異常偵測、精準計數等,能捕捉1FPS取樣容易遺漏的瞬間狀態變化與精確剪輯邊界。詳細內容請見原文連結。
💬 JudyAI Lab 觀點
根據原文摘要撰寫如下:
Gemini今日為3.7Flash、3.6Flash與3.5Flash-Lite三款模型推出「代理式影片理解」能力,讓模型主動決定要看哪段影片、用什麼取樣速度與模態,而不是固定每秒抓一幀。這個轉變值得AI觀察者留意。
過去靜態取樣的做法,常讓開發者在token成本與細節完整度之間二選一,尤其長影片(10分鐘教學到多小時錄影)特別吃虧。官方資料顯示啟用後分析成本最高降66%,token消耗最高減88%,準確率最高提升7%,其中Gemini3.7Flash更達到帕累託前緣。這反映一個更大的設計思維轉向:與其讓模型被動接收固定格式的輸入,不如讓它像人一樣主動判斷「這裡需要細看,那裡可以跳過」,把工具呼叫的能力延伸進感知層本身,而不只是推理層。這種「目標導向取樣」的邏輯,未來很可能會複製到其他長輸入場景。
如果你的產品正在處理長影片或多小時錄影,可以優先評估這個功能能否直接降低現有pipeline的token成本。
📅 原文資訊
- 發布時間:2026-09-01T17:08
- 來源原文:https://deepmind.google/blog/introducing-agentic-video-in-gemini/