Google DeepMind 7 月 30 日發表 Gemini Robotics ER 2,重點不是「機器人手更巧」,而是它終於會一邊做事、一邊回頭看自己做到哪、做壞了會自己調整——抓關鍵時刻的準確度 91.3%、平均只差 0.96 秒,而且比更大的模型快 4 倍。這篇幫你把官方說的拆成人話,順便講一下:這對我們這種「教人用 AI」的人,代表什麼。
先講來源:誰在什麼時候發的
2026 年 7 月 30 日,Google 在官方部落格 The Keyword 上發布〈Introducing Gemini Robotics ER 2〉,作者是 Google 的 Steven Hansen(Senior Staff Software Engineer)與 Peng Xu(Staff Software Engineer)。
官方自己給的定位是這句:這是「a step change in powering robots with video understanding, task orchestration, and multi-robot collaboration」——影片理解、任務編排、多機器人協作,三件事一起往前跳一階。
而整篇文章的靈魂,我覺得是這一句:
「For robots to assist humans in everyday environments, accurate spatial reasoning is not enough.」
(機器人要在日常環境裡幫上人的忙,光是空間判斷準確,還不夠。)
翻成白話:以前大家比的是「機器人看不看得懂東西在哪」,現在比的是「它知不知道自己這件事做到哪一步、做對了沒」。
問題出在哪:會做事,不代表知道自己做得對不對
你可以先想一個很生活的畫面。你請一位新來的同事去倉庫拿三樣東西,他拿了兩樣、第三樣找不到,卡在那裡。差別在哪?一個會回你「第三樣缺貨,要不要換?」,一個是站在原地不動,等你去問他。
過去的機器人比較像後者。它可以照著指令動,但它沒有一個持續的「我現在做到第幾步」的概念——所以中間出一點意外,整條流程就斷掉,得靠人重下一次指令。
ER 2 想補的就是這一格:讓機器人一邊動,一邊用攝影機拍到的連續影像判斷「進度」。官方那句話講得很好——它的設計是讓機器人「think about what comes next while simultaneously performing its actions」,一邊做,一邊想下一步。
它到底多會了什麼?三件事
1. 它是「大腦」,不是「手腳」
這點一定要先講清楚,不然很容易誤會。ER 2 不是拿來直接控制馬達的模型,官方的用詞是 high-level brain——高階大腦。真正動手的是另一種叫 VLA(Vision-Language-Action,視覺-語言-動作)的模型,或是機器人本身的 API。
ER 2 負責的是:看懂現場、把一句人話拆成好幾步、決定現在該做哪一步、判斷做完了沒。用我們熟悉的比喻,它比較像那個拿著工單、站在旁邊指揮的組長,不是拿螺絲起子的那雙手。
2. 它會邊做邊看自己,做壞了會回頭修
這是這次最有感的升級。ER 2 可以直接從原始影片串流判斷成功或失敗,官方給了兩個指標:
- 進度分類(Progress Classification)準確度 57.4%——在 5 個進度等級上判斷「現在做到哪」,官方說贏過上一代 ER 1.6 與同級的前沿模型。
- 關鍵時刻查找(Moment-Finding)準確度 91.3%,平均絕對誤差只有 0.96 秒——也就是「這段影片裡,事情是哪一刻發生的」,它幾乎抓得到那一秒。
- 速度比更大的模型快 4 倍,延遲在 1 秒以內。這點在真實場景很關鍵:判斷再準,慢半拍也沒用。
官方也說,ER 2 能透過連續的影片觀察追蹤進度、在失誤時自我調整、知道什麼時候該進到下一步——這三件事以前是要人在旁邊盯的。
3. 它會自己叫工具,還會協調好幾台機器人
ER 2 可以原生呼叫工具,官方明講的包含 Google 搜尋、或任何使用者自訂的函式。意思是:機器人遇到「這罐東西是什麼、該怎麼處理」不確定的時候,可以自己去查,不是回頭問人。
多機器人協作是另一個新東西。官方展示了兩組:
- Boston Dynamics 的機器狗 Spot:用 ER 2 去編排 Spot 原本的 API(導航、機械臂移動),聽一句自然語言就去把東西取回來;官方說範例程式碼放在 GitHub。
- Apptronik 的人形機器人 Apollo 2 + Franka F3 Duo 機械臂:兩種完全不同的機器人,一起分工完成同一件複雜任務。
數字上真的有差嗎?官方自己的對照圖
Google 放了一張 ER 1.6 跟 ER 2 的成功率對照,三種情境都往上走:
- 控制真實 VLA 模型:48.6% → 60.0%
- 控制模擬環境的 VLA:37.4% → 42.9%
- 控制人類遠端操作:63.6% → 74.0%
順帶一提,看到「60%」不要嚇到,這是機器人在真實世界做完整任務的成功率,跟考試 60 分不是同一回事——這個領域的難度,本來就跟純軟體差一個量級。
安全的部分,這次寫得比以前明確
官方特別提了兩塊:一是 Safety Instruction Following(遵守安全指令)有明顯提升,二是在 Human Proximity(人員接近)這個基準上表現好——實際的行為是:有人靠近時,它能自主讓人形機器人停下來。
另外一個我覺得很實用的小能力:通用儀表讀數。官方說涵蓋 10 種不同類型的儀器,包含數位顯示器、線性刻度、液體溫度計這些。這聽起來很不性感,但你想想工廠、機房、倉儲那些還在靠人走一圈抄表的地方,這個能力比會後空翻有用多了。
我自己的體會:這其實是「交辦」這件事在進化
我平常的工作是做教育訓練,把冷冰冰的規格翻成第一線同仁聽得懂的話。這幾年講 AI 講最多的一句話是:會操作,不等於會交辦。
前陣子我剪一支旅遊影片,其實就是這個感覺。我不喜歡預設的字體,就問 AI「YouTube 影片常用什麼字體」,它給了答案之後,我直接請它去下載、套用——整個過程我幾乎沒有親手操作。那時候我心裡想的是:真正的差別不在 AI 多強,而在我知不知道「字體」這個環節存在、講不講得出我要什麼。
所以 AI 能幫你做到多深,其實取決於你的想像力、你的工作能力,還有你原本的專業。你懂的工具越多、專業度越強,它交出來的成果就越好——設計師本來就懂 Banner 的流程跟表現方式,這些 know-how 丟進 AI,是在原本的專業上放大,不是取代。
ER 2 這次做的事,本質上就是把「回報進度」這個動作內建到 AI 身上。以前你交辦完,得自己盯著看它做到哪;現在它會舉手說「我做到第三步了,這步失敗,我換個方式」。人的角色沒有變輕,反而更前面——你要負責的是定標準、給對工具、驗收品質,而不是站在旁邊監工。
套用前,有幾點要注意
- 這是給開發者的模型,不是你能買回家的機器人。目前開放的管道是 Gemini API 與 Google AI Studio(模型代號 gemini-robotics-er-2-preview),另外 Gemini Enterprise Agent Platform 是私密預覽。一般消費者現在買不到、也用不到。
- 台灣的時程、價格,官方都沒說。文章裡沒有提到任何區域上市資訊,我也不會替它猜。
- benchmark 數字是官方自評。57.4%、91.3%、快 4 倍這些,都是 Google 自己公布的測試結果,第三方還沒有對照驗證,看的時候心裡有個底就好。
- 它仍然需要搭配「手腳」。ER 2 只是大腦,實際要跑起來,還得有 VLA 模型或機器人本身的 API 配合,不是裝上去就會動。
小結
如果要我用一句話講完這次的更新:機器人從「聽得懂指令」,走到「知道自己做到哪」。
這件事對第一線工作的意義,比多一隻手還大。因為我們把事情交給人,最在意的從來不是他手快不快,而是——出狀況的時候,他會不會講。
本文整理改寫自 Google 官方部落格 The Keyword,2026 年 7 月 30 日發布的〈Introducing Gemini Robotics ER 2〉,作者 Steven Hansen、Peng Xu。文中所有數字與功能描述均引自該篇官方文章,個人觀點與使用經驗為本站自行補充。
留言
張貼留言