AI 影片不滿意只能重做?Google Gemini Omni 讓你用講的改,5 個官方實測玩法

過去一年用 AI 生影片,最讓人洩氣的不是畫面不好看,是「不滿意就只能重來」。改一個鏡位、把白天換成傍晚,你只能重新下一次指令、重抽一次,然後人臉變了、場景也變了。Google 8 月 7 日公開的 Gemini Omni 想解決的就是這件事:把生影片從「抽獎」變成「對話」——講一句就改一次,而且改完還是同一個畫面。

Google Gemini Omni:影片不重做,用講的改

這是誰講的?Google 官方 8 月 7 日的第一手發布

消息來源是 Google 官方部落格 The Keyword,2026 年 8 月 7 日那篇〈See what 5 builders are making with Gemini Omni〉,內容是五組創作者拿 Gemini Omni 實測的成果。模型本身的規格則在 Google DeepMind 的官方模型頁上,一句話定位講得很白:

「Create anything from anything, starting with video.」(從任何東西創造任何東西,先從影片開始。)

官方對它的描述是「讓製作和編輯影片,簡單得像在講話一樣」。輸入可以是文字、圖片、影片或聲音,輸出是影片;重點不在「能生」,在「能一直改」。

Gemini Omni 官方主視覺,展示黏土動畫、素描轉實拍、遊戲化畫面等生成範例
圖/Google DeepMind 官方 Gemini Omni 頁面(來源

問題出在哪:以前的 AI 影片是「一次性商品」

你可以想像成點一杯手搖飲。以前的 AI 生影片,是你講完「大杯少冰半糖」,店員直接做一杯給你,你說「冰再少一點」,他不是調整那一杯,是重做一杯——連杯型、甜度都可能跟上一杯不一樣。做十次,你手上有十杯不同的飲料,卻沒有一杯是你要的那杯。

Gemini Omni 主打的三件事,就是在補這個洞。

Gemini Omni 改變了什麼:多輪對話編輯、懂真實物理、保持畫面一致性
(本站自製資訊圖)
  • 多輪編輯:改完再改,一輪一輪疊上去,不用整支重生。
  • 一致性:官方強調多次修改之間會維持同一個畫面的連貫,不會改一次換一張臉。
  • 物理理解:官方文件寫得很具體——重力、動能、流體力學。所以東西掉下來會照現實掉,水會照現實流。

另外還有幾項寫在官方能力清單裡:把動作和風格從一支影片轉移到另一支、用一張圖直接替換畫面裡的角色或物件、把素描變成寫實影像、讓字幕文字跟畫面動作對得上。

官方展示的玩法:五組創作者實際做了什麼

那篇部落格挑了五組創作者的實測,我整理成「你聽得懂、也能照抄」的版本。

官方展示的三個實測玩法:換鏡位、換場景天氣、塗鴉變實拍
(本站自製資訊圖)

1. 換鏡位:一個畫面,切出約 20 種角度

第一位創作者拿一段「女生走在城市裡」的影片,用指令把鏡頭換了大約 20 種視角——特寫、遠景、俯視、仰視都有。等於一支素材當 20 支用。以前這叫「多機位拍攝」,要多台相機、多顆鏡頭、多跑幾趟。

2. 換環境:白天變夜晚、樹葉變橘、蓋上積雪

第二位是用「講的」去換戶外場景的天氣與時間:加上雲層、把葉子變成橘色、讓地面覆蓋積雪。這一項對做教材或商品情境影片的人最有感——同一個場景,一次生出四季版本。

3. 塗鴉指路:檸檬變潛水艇、咖啡變熱氣球

第三位的做法最好玩:直接在畫面上塗鴉,告訴 AI 這個東西要怎麼動。他把檸檬畫成潛水艇、把咖啡畫成熱氣球,AI 就照著那個塗鴉把物件變成寫實影像。這是「用畫的下指令」,比打字精準——你不用形容「我要它從左邊游過去」,畫一條線就好。

4. 換風格:真人影片轉動畫、轉黏土動畫

第四位把同一段女生走路的影片,轉成四種動畫風格,包含黏土動畫那種質感。同一則訊息,要給不同族群看的時候,換皮不換骨。

5. 概念視覺化:把抽象的東西變成看得懂的畫面

第五組是一個團隊,做的是把抽象概念影像化——景觀設計的「改造前 vs 改造後」對照、把數據變成有角色的畫面、把待辦清單做成遊戲化的樣子。這一類最接近簡報和教材的用途。

在哪裡用得到?官方列的入口比想像多

Gemini Omni 不是只綁在一個 App 裡。官方模型頁列出的入口包含:

  • Gemini App——一般人最直接的入口
  • Google Flow——Google 的 AI 影像創作工具
  • YouTube Shorts——直接在短影音端用
  • Google Vids——Workspace 裡做影片簡報的那個
  • Google AI Studio / Gemini API——想自己接程式的走這裡
  • Google Enterprise Agent Platform——企業端

另外官方也提到 Picsart、Artlist、Stan、FLORA 等合作夥伴的整合。對一般使用者來說,實務上會先碰到的是 Gemini App、YouTube Shorts 跟 Google Vids 這三個。

我自己怎麼用:一支母片,改出多個版本

我做教育訓練,一年要產出的短影音教材不少,最花時間的從來不是「拍」,是「改」。同一支流程說明,要給不同對象看,就得重做旁白、重換情境、重新輸出一次。

7 月底我試過一次「讓 AI 幫我剪」的完整流程:我不喜歡預設字體,就直接問它 YouTube 常用什麼字體,再請它下載、套用,整支旅遊影片就剪出了一個版本,過程幾乎不需要我親手操作。那次的心得是——AI 剪片現在還不算完全成熟,但只要給它對的工具、或請它自己去找工具,它就能開始幫你做。

另一次做教學影片,我是用 Gemini 生情境畫面跟背景音樂,旁白用 Google AI Studio 的文字轉語音配。以臺灣中文來說,AI Studio 的聲音目前是我聽過最自然的,還能加語氣和抑揚頓挫,再結合真實的操作畫面剪在一起,成品比我自己配音那版還穩。

把 Gemini Omni 這一手接上去,我最想試的是這件事:一支教材母片,用講的改成多個版本。同一段情境,換成門市版、換成企業內訓版、換成給完全沒基礎的長輩看的版本——不用重拍,也不用重生,只要換講法。這對做教材的人來說,是省下的不是特效,是重來的時間。

先別衝:動手前要知道的三件事

動手前先知道三件事:需訂閱、SynthID 浮水印、官方自評數據
(本站自製資訊圖)
  • 要付費、而且看地區:官方頁面明講需要 Google AI 訂閱,功能會依方案等級與地區而不同。台灣看得到什麼,實際登入才準。
  • 生成內容都有記號:Google 說產出的內容會嵌入 SynthID 這種肉眼看不到的數位浮水印,並整合 C2PA 內容憑證,可以在 Gemini App 裡驗證,之後會擴到 Chrome 和搜尋。這代表你拿 AI 生的畫面去當「真實素材」,是驗得出來的——做教材、做商用內容,該標就標。
  • 那些「領先」是官方自評:官方說在 504 個以上的例子、由人工評分的內部測試中,Gemini Omni Flash 在影片編輯的指令遵循、文字生影片的整體偏好度上領先,圖片生影片則是打平。要注意這是 Google 自家做的評測,不是第三方公正機構的結果,參考就好。

小結

Gemini Omni 真正的重點只有一句:AI 影片從「重生」變成「重講」。以前是抽到滿意為止,現在是講到滿意為止。這兩件事對做內容的人來說,差的是幾個小時。

如果你手上已經有一支不太滿意的影片,別急著重做。先想清楚你要改的是鏡位、環境、風格,還是裡面某一個物件,然後一次講一件事、一輪改一件事——這才是這種對話式編輯真正的用法。


本文整理改寫自 Google 官方部落格 The Keyword 2026 年 8 月 7 日〈See what 5 builders are making with Gemini Omni〉,以及 Google DeepMind 官方 Gemini Omni 模型頁(deepmind.google/models/gemini-omni)。功能、平台與限制以官方公告為準。

留言