AI 看影片整理重點會漏段?Google 官方公布 Gemini 新做法:token 省 88%、準確度多 7%

丟一支一小時的錄影給 AI,問它「第幾分鐘講到報價」,答案卻歪掉——這不是它不夠聰明,是它看影片的方式從頭到尾都一樣笨。Google 在 9 月 1 日公布 Gemini 的 agentic video understanding,讓模型自己決定要看哪一段、用多快的速度看、要看畫面還是聽聲音,官方數字是 token 用量最多降 88%、成本最多降 66%、準確度最多多 7%。

Gemini agentic video understanding 官方發布

誰說的、什麼時候說的

2026 年 9 月 1 日,Google 在官方部落格 The Keyword 發表〈Introducing agentic video understanding with Gemini〉,作者是 Google DeepMind 的資深產品經理 Rohan Doshi 與研究總監 Mario Lučić。這次上線的模型是 Gemini 3.7 Flash、3.6 Flash 跟 3.5 Flash-Lite 三顆。

官方對這件事的定位寫得很直白:「Our new agentic feature for video analysis cuts token consumption by up to 88%, reduces costs by up to 66%, and boosts quality by up to 7%.」重點不是模型變聰明,是它處理影片的方法換了。

AI 看影片整理重點,為什麼常常漏掉?

先講原本的做法。過去 Gemini 讀影片是「靜態處理」:以固定的每秒格數把整支影片吃進去,預設是 1 FPS,也就是一秒抽一格畫面。API 可以調,但調高調低都很兩難。

調低,快速動作、鏡頭切換這種一秒內就結束的細節直接消失,你問「他手比了幾次」它只能猜。調高,一支 90 分鐘的演講換算下來是幾十萬個 token,錢燒得比誰都快。官方原話是,開發者被迫「在高 token 成本,跟會丟掉關鍵細節的技巧之間二選一」。

更根本的問題是:影片裡 90% 的內容跟你的問題無關。你只想知道報價講在哪一段,它卻從第 1 分鐘一路抽到第 60 分鐘。

AI 看影片以前跟現在的差別
以前整支抽格,現在自己挑段落(本站自製資訊圖)

Google 改了什麼:從「整支抽格」變成「自己決定看哪一段」

agentic video understanding 的做法,是把模型的推理能力跟 Gemini 原生的影片工具接起來,讓它在回答之前先跑一個迴圈:看一下、想一下、決定下一步要抓哪一段。

官方的示意圖把這個迴圈畫得很清楚——你丟進影片跟問題,模型進入 Observation(觀察)跟 Think(思考)的循環,中間它可以呼叫三個工具:get_transcript 拿字幕、get_frames(start, end, fps) 抓某個時間區間的畫面、get_audio(start, end) 拿某一段聲音。要哪段、要多細,它自己決定。

Gemini agentic video 運作示意圖
圖/Google 官方部落格 The Keyword(來源

三個工具對應三種模態:字幕、畫面、聲音。以前是三種全部照吞,現在是哪個問得出答案就用哪個。這種「先問自己該看哪裡」的能力,Google 之前在圖片上做過一次,叫 agentic vision,這次是把同一套搬到影片。

官方數字:token 省 88%、成本省 66%、準確度多 7%

三個數字都是官方在標準影片分析基準測試上跑出來的,前面都有「最多」(up to),不是每支影片都會這樣。

Google 官方公布的三個數字
官方公布的三個效益數字(本站自製資訊圖)

官方圖表把 Gemini 3.7 Flash 開跟不開 agentic 的差別列出來,看單支查詢的 token 數就很有畫面:長影片理解的 1H-VideoQA 從 397.6K 掉到 47.7K、LVBench 從 300.3K 掉到 36.0K,兩個都是 88.0% 的節省;複雜推理的 Minerva 從 80.9K 降到 33.6K,省 58.4%。準確度同時往上,Minerva 從 73.7% 到 79.0%、LVBench 從 85.1% 到 88.6%。

Gemini 3.7 Flash 開啟 agentic 前後的 token 與準確度對照
圖/Google 官方部落格 The Keyword(來源

少讀 88% 的內容、答案反而更準,聽起來矛盾,其實很合理:以前那些被硬吞進去的無關畫面,本來就是干擾。官方也說這個效益在長影片上最明顯,範圍從 10 分鐘的教學影片、90 分鐘的演講,一路到好幾個小時的錄影。三顆模型都支援,但官方點名 Gemini 3.7 Flash 開 agentic 的整體品質最好,也是準確度對成本最划算的那一顆。想知道 Flash 系列各版本的定位跟計價差別,可以看之前整理的〈Gemini 3.8 Flash 是什麼?官方 4 個重點看懂費用、去哪用、跟 3.7 差在哪〉。

實際能做什麼?官方點名 4 種用法

  1. 秒級找片段:抓出 1 FPS 會直接錯過的瞬間狀態變化跟剪接點,讓自動剪片有辦法對準。
  2. 長片大海撈針:在好幾小時的影片裡回答複雜問題,不用燒掉幾百萬個 token。
  3. 異常偵測:對可疑的時間區間拉高抽格率重看,檢查快速動作跟細微的畫面瑕疵。
  4. 數數量:準確追蹤重複的動作次數,或畫面裡有幾個不同的物件。

把這四種翻成日常場景:一小時的會議錄影問「決議是什麼、誰負責」、幾小時的行車紀錄器問「哪一段有異常」、一支教學影片問「他總共示範了幾次」。錄音轉文字那條線我之前寫過〈會議記錄怎麼寫?錄音轉完只是逐字稿,3 步驟讓 AI 生出能交的會議紀錄〉,差別在那篇處理的是聲音,這次多的是「畫面裡發生什麼」。

怎麼用?開發者今天就能開,一般人再等一下

現在誰用得到、怎麼開
開通管道與時程整理(本站自製資訊圖)

開發者:功能現在就在 Gemini API 上,管道是 Google AI Studio 跟 Gemini Enterprise Agent Platform,支援上傳的影片檔跟 YouTube 影片。開法只有一步:在 API 設定裡把 processing 設成 "agentic"。計價沿用原本的 Gemini API token 價格,沒有額外的功能費。

一般人:官方說這套會推到 Gemini app 的所有使用者,跑在 Flash 與 Flash-Lite 上,時間點寫的是「soon」;YouTube 影片頁的「Ask YouTube」問答則是「未來幾個月」會換成這套。所以現在打開 Gemini app 還不會馬上有,時程官方也沒給到日。

我的看法:這是把「看影片」從 workflow 換成 agent

我前幾天剛好在整理一個判準:什麼時候該用 workflow、什麼時候該叫 agent。我自己分三層——流程完全固定、不用做任何判斷的,其實 RPA 就解決了;流程固定但過程要微調的,用現在很流行的 Cowork 模式就夠;只有隨機性高、必須自己判斷下一步的,才值得交給 agent。

用這個判準回頭看 Google 這次做的事,就很清楚了。以前的「每秒抽一格、從頭跑到尾」是標準的 workflow:步驟固定、不看內容、不做選擇。現在的做法是給它一個目標(回答你的問題),讓它自己判斷要看哪裡、看多細——這才是 agent。

這對我的實際影響是成本結構變了。以前想把長影片的素材壓成重點,我的習慣是先轉逐字稿、再丟文字給 AI,因為直接丟影片太貴。但逐字稿有個先天缺陷:投影片上寫的數字、螢幕上按了哪個按鈕,逐字稿裡一個字都沒有。這次的變化讓「連畫面一起看」變得付得起,我接下來想試的第一件事,就是拿一支自己錄的教學影片,直接問它「投影片上出現過哪些數字」,看它能不能比逐字稿那條路更完整。

用之前先知道的 3 件事

  1. 那三個數字都是「最多」:88%、66%、7% 是基準測試上的上限值,官方也註明測試條件是高思考等級、低媒體解析度、靜態處理用 1 FPS。你的影片能省多少,看內容跟問題而定。
  2. 短影片不一定划算:官方明講效益在長影片上最明顯(10 分鐘以上到數小時)。一支 30 秒的短片,原本的做法本來就沒多貴。
  3. 現在還是開發者的功能:要今天就用得到,你得會呼叫 API 或進 AI Studio。只用 Gemini app 的話,等它推過來就好,不用急著找設定。

小結

這次更新的重點,不是 Gemini 突然變得更會看影片,是它終於會「挑著看」。少讀 88% 的內容、答案還更準,證明的是同一件事:把判斷權交給模型,比把所有資料硬塞給它有用。

先記住兩個時間點就好:開發者今天就能在 AI Studio 把 processing 設成 agentic;一般人等 Gemini app 跟 YouTube 問答推過來。等它上線,第一支你會想丟進去的影片是什麼?

延伸閱讀


本文整理改寫自 Google 官方部落格 The Keyword 2026 年 9 月 1 日發布的〈Introducing agentic video understanding with Gemini〉,作者 Rohan Doshi、Mario Lučić。文中數字與功能說明皆以該篇官方公告為準。

留言