錄了一小時的訪談,丟進轉文字工具,出來的稿子錯字一堆、還把「嗯…那個…」全部照抄,光是清理就花掉兩個小時——這件事在 8 月 26 日之後有機會不一樣。Google 官方發布了新的語音轉文字模型 Gemini 3.5 Transcribe,錯字率、支援語言、出稿速度都給了具體數字,而且一般人現在就有地方可以用。這篇把官方講的拆成人話,順便講我自己怎麼用。
這是誰發的?Google 官方 8 月 26 日的公告
消息來自 Google 官方部落格 The Keyword,2026 年 8 月 26 日發布,署名的是 Gemini Audio 團隊的工程資深總監 Diego Melendo Casado 與幕僚長 Luke Leonhard。官方開頭這句話講得很直白:
「跟一般語音辨識模型不一樣,那些模型碰到背景噪音、專業術語、講話結巴就卡住;Gemini 3.5 Transcribe 是把原始音訊直接轉成準確、乾淨、排好版的文字。」
(原文:Unlike conventional speech recognition models that struggle with background noise, complex jargon, and disfluency cleanup, Gemini 3.5 Transcribe converts raw audio directly into accurate, polished, formatted text.)
句子裡藏了一個重點:它做的不只是「聽寫」,而是「聽寫完再幫你整理一次」。這是它跟你手機內建那種語音轉文字最大的差別。
為什麼以前的錄音轉文字這麼難用?
先講清楚問題出在哪,後面的數字才有感覺。傳統語音辨識是「聽到什麼字就打什麼字」,所以你會拿到三種很煩的東西:
- 逐字照抄的贅字:「嗯」「啊」「那個」全部進稿,一句話裡有三個「然後」。
- 沒有斷句的一長條:整段沒有標點,回頭讀等於重看一次。
- 專有名詞全錯:人名、產品型號、公司內部術語,聽起來像什麼就打成什麼。
所以「AI 幫你轉一份逐字稿」聽起來很方便,實際做完你還要再花一輪時間校稿——省下來的時間又還回去了。Google 這次改的就是這一段。
官方公布的 4 個數字,一個一個看
1. 錯字率 2.6%:一百個字大概錯 2 到 3 個
官方引用第三方評測機構 Artificial Analysis 的測試結果:處理「已經錄好的音檔」平均字錯率(WER,Word Error Rate)是 2.6%;「邊講邊出字」的即時串流情境是 4.0%。
WER 白話講就是「一百個字裡面錯幾個」。2.6% 代表一百字大約錯 2 到 3 個字,通常是同音字或人名。這個水準已經到「校稿是掃過去改幾個字」,而不是「重打一遍比較快」。
2. 超過 85 種語言,會自己判斷你在講哪一種
官方寫的是自動偵測並轉寫 85 種以上語言,各地口音和方言也吃得下。重點在「自動偵測」——你不用先去設定語言,中間換語言講它也跟得上。開會時中英夾雜的人應該最有感。
3. 出稿速度比前一代快 70%
跟 Google 前一代的轉錄模型 Chirp 3 相比,同樣由 Artificial Analysis 測,「拿到最終稿的時間」快了 70%。這個數字影響的不只是等待,還有那種「你講完它才慢半拍跳字」的卡頓感。
4. 分得出最多三個人在講話
預錄的音檔可以做「誰講的」標記,官方說準確支援到 三位講者,並附上逐字的時間戳記;三人以上目前還算實驗性質。訪談、雙人 podcast 剛好落在這個範圍,四五個人的會議就要有心理準備。
跟 ElevenLabs、OpenAI 比呢?官方自己放了這張圖
Google 這次直接放了 FLEURS 這個多語言測試集的對照圖,把自家和幾個常被拿來比較的服務放在同一張圖上。串流模式下,Gemini 3.5 Transcribe Live 是 5.50% WER,前一代 Chirp 3 是 7.32%,其他三家分別落在 8.97% 到 15.77% 之間(這張圖是越低越好)。
看這種圖有個前提要先講:這是 Google 自己選的測試條件、自己做的比較,看趨勢可以,別當成絕對排名。不過圖下方那排小字有個對台灣人有用的資訊——測試涵蓋的語言代碼裡有 cmn-Hans-CN,也就是中文有被納進去測。非串流模式官方給的 FLEURS 成績是 5.04%。
| 情境 | Gemini 3.5 Transcribe | 說明 |
|---|---|---|
| 錄好的音檔 | WER 2.6% | 訪談、會議錄音、課程側錄 |
| 邊講邊出字 | WER 4.0% | 語音輸入、即時字幕 |
| FLEURS 多語言(串流) | 5.50%(前代 7.32%) | 含中文在內的多語言測試 |
| FLEURS 多語言(非串流) | 5.04% | 同上,但處理錄好的檔案 |
它「聰明」在哪?三件以前要你自己做的事
會處理你的改口。官方舉的例子很生活:你說「我們禮拜二見——不對,禮拜三」,它知道要留的是禮拜三,不是把兩個都打出來讓你自己猜。
會刪贅字。「嗯」「啊」這種填充詞直接濾掉。做過逐字稿的人都知道,光這一項就省掉一大半的清理工。
會自動排版,也認得你給的詞。斷句、標點它自己處理;你可以先餵它一份自訂詞彙表,公司內部的產品名、特殊拼法就不會每次都聽錯。這一項對做教育訓練、做內容的人特別有用,因為我們的稿子裡專有名詞密度高得嚇人。
錄音轉文字 app 現在哪裡用得到?三個入口
官方在文末的「Start using 3.5 Transcribe today」把對象分成開發者、企業、一般人三種。一般人這欄寫得很清楚,就三個地方:
Android 手機:Gboard 的 Rambler
Google 鍵盤 Gboard 上有個新功能叫 Rambler,用法就是照平常那樣按語音輸入,然後把想講的一口氣講出來——它會把你散裝的口語整理成排好版的文字,順手濾掉贅字。你還可以用講的下指令改稿:改錯字、換個寫法、調整語氣。官方註明目前是「部分國家與語言」,台灣使用者要自己開來看有沒有到。
Mac 電腦:macOS 版的 Gemini App
這條線我在〈Mac 上長按一個鍵,用講的就能打字、改文、生圖〉寫過,當時的重點是「長按一顆鍵就能對電腦講話」。這次官方補的是背後換了模型之後多出來的能力:它不只把話變成文字,還能搭配你螢幕上的內容執行工作——用講的叫它摘要本機檔案、把一段文字改寫貼到另一個 app、直接在游標位置生圖。官方註明目前限英文。
Chrome 瀏覽器:官方說即將推出
之後在網頁的任何輸入框都可以用講的打字,回訊息、寫貼文、對 Chrome 裡的 Gemini 下指令都算。這一項還沒上線,官方寫的是 coming soon。
另外兩條是給比較進階的人:想自己串應用的,Gemini API 在 Google AI Studio 開了公開預覽,即時串流用 gemini-3.5-transcribe-live、處理錄好的音檔用 gemini-3.5-transcribe;企業端則走 Gemini Enterprise Agent Platform。
我自己怎麼用:先把「輸入」加速,AI 的產出才會準
我做教育訓練,工作內容有一大塊是把很硬的技術規格,翻成第一線同仁聽得懂、用得上的話。這種工作最花時間的從來不是「寫」,是「把腦袋裡那團東西倒出來」。
之前聽到一份 2016 年史丹佛大學的研究,結論是語音輸入的效率大約是打字的三倍。當時我記在日記裡,因為它解釋了我一直有的一個感覺:打字會讓人自動精簡。你一邊打一邊想「這句太長了」,最後留下的是被你壓縮過的版本。
這件事在 AI 時代反而變成問題。以前做筆記追求言簡意賅,是為了自己回頭看得快;但你要 AI 幫你做事,給它的脈絡越完整、細節越多,它給你的東西才會越貼近你要的樣子。我現在每天的日記都是用語音輸入工具講完的,講的時候不修剪,讓它保留我當下完整的想法,之後 AI 進去撈這些日記,幫我整理成部落格、社群貼文或報告,素材才夠厚。
所以我看這次的 Gemini 3.5 Transcribe,重點不在「又一個轉文字工具」,而在錯字率低到某個程度之後,語音輸入才真的能取代打字。以前 WER 十幾趴的時候,你講三分鐘要校十分鐘,那不如用打的;現在降到 2.6%,這個算式才翻過來。我先前整理過七月那波 Gemini Drop 的語音更新,那時候的感想是「終於可以對電腦講話了」;這次補上的是準確度那一塊。
實際做法我只有兩個習慣,很簡單:第一,講的時候不要修剪,想到什麼講什麼,重複、跳題都沒關係,反正它會幫你整理。第二,把常用的專有名詞先建一份自訂詞彙,公司產品名、課程名稱這種東西,設定一次可以少改幾百次。
用之前要知道的幾件事
- 台灣不一定馬上有。Gboard 的 Rambler 官方寫的是「部分國家與語言」,macOS 版目前限英文,Chrome 那條還沒上。中文使用者要有耐心。
- 數字是官方和第三方在特定條件下測的。2.6% 是實驗室等級的乾淨音檔;你在有冷氣聲、有人插話的會議室錄,結果一定比較差。
- 三個人以上的會議先別全靠它。官方明說三位講者以上還在實驗階段,多人會議記錄還是要人工核對誰講了什麼。
- 錄音檔上傳前先想一下內容。涉及客戶資料、內部未公開資訊、他人隱私的錄音,丟到任何雲端服務前都該先確認公司規範,這跟工具準不準是兩件事。
- 它終究是「轉錄」,不是「理解」。你要的如果是會議重點和待辦,那是另一件事,我在〈開會不用再邊聽邊抄了——Gemini 幫你做會議筆記〉寫過那條路線。
小結
這次的更新拆開來就一句話:錄音轉文字的錯字率降到 2.6%,語音輸入從「玩具」變成「可以放進工作流程的東西」。85 種語言、快 70%、分得出三個人,這些都是為了同一件事服務——讓你不用回頭校稿。
對一般人的意義是,你手機裡那個很少按的麥克風圖示,值得再試一次。對每天要產出內容的人,意義更大:輸入變快三倍,你能餵給 AI 的脈絡就厚三倍,出來的東西才會像你要的。
你平常都用什麼做逐字稿?是手機內建、付費工具,還是乾脆自己打?留言聊聊。
延伸閱讀
- Mac 上長按一個鍵,用講的就能打字、改文、生圖——Gemini 把語音變成你的第二雙手
- 打字打到手痠?Google 七月 Gemini Drop 6 項更新:長按一顆鍵,對電腦講話就成稿
- 開會不用再邊聽邊抄了——Gemini 幫你做會議筆記,抓重點、列待辦、還幫你寄出去
本文整理改寫自 Google 官方部落格 The Keyword,2026 年 8 月 26 日發布:Intelligent transcription with Gemini 3.5 Transcribe。文中數據與功能說明皆以官方原文為準。
留言
張貼留言