聲音克隆免費怎麼做?我 50 幾支短片的旁白都是 AI 唸的:本機 3 步驟,加 1 個踩了 4 個月的坑

聲音克隆免費怎麼做:用 Voicebox 在 Mac 本機克隆自己的聲音做影片旁白

從 7 月中到現在,我做了 50 幾支直式短影音,旁白一句都不是我對著麥克風錄的,全部是 AI 克隆我的聲音唸出來的。用的工具免費、開源、在 Mac 本機跑,聲音樣本不用上傳到任何雲端。這篇把 3 個步驟寫清楚,最後講一個我自己踩了 4 個月才發現的坑,你可以直接跳過。

聲音克隆是什麼?免費版能做到什麼程度

聲音克隆就是給 AI 一小段你的錄音,之後你打任何文字,它都用你的聲音唸出來。現在開源模型已經做到「幾秒鐘樣本就能克隆」,而且可以整套裝在自己電腦上跑,不用付月費、不用把聲音交給別人。我用的是兩個開源專案疊起來:

  • Qwen3-TTS:阿里雲 Qwen 團隊 2026 年 1 月 22 日開源的語音合成模型,有 0.6B 和 1.7B 兩個大小,支援中文在內的 10 種語言,官方說明寫的是「3-second rapid voice clone」——3 秒的使用者音檔就能快速克隆。授權 Apache-2.0。
  • Voicebox:把 Qwen3-TTS 包成一般人能用的桌面 app,開源(MIT),有 macOS、Windows、Linux 版。官方 README 講得很白:「Complete privacy — models, voice data, and captures never leave your machine」,模型、聲音資料、錄音都不會離開你的電腦。Mac 上用 MLX 後端吃 Apple Silicon,官方數字是快 4–5 倍。

我是 5 月 11 日裝的,當時就把自己的聲音克隆好、建了一個叫「董達達」的聲音檔。之後每支短片的旁白,都是把稿子貼進去、按生成、把 wav 拿去剪片。

Voicebox 官方畫面:左側是已克隆的聲音清單,下方可選 Qwen3-TTS 1.7B 模型生成語音
圖/Voicebox 官方 GitHub README 截圖(來源

為什麼要在本機跑,不用線上的聲音克隆服務?

三個理由:聲音不上雲、沒有額度限制、夠快。線上服務不是不好,但你的聲音是很個人的東西,我不想把它存在別人的伺服器上;而且短影音旁白常常要重配好幾次,用點數計費的服務,改一個字就扣一次。

速度我有實際數字。9 月 17 日那天我拿同一支影片的 6 段旁白做比較:Voicebox 在我的 Mac 上跑完 3 分多鐘,之前用的另一套開源模型要 10 到 15 分鐘,差了大約 4 倍。對我來說這不是「快一點」,是「等得下去」跟「先去泡咖啡」的差別。

之前寫過的〈本機 AI 怎麼跑?NVIDIA 官方 IFA 4 個重點,加 3 步驟用 Ollama 在自己電腦跑模型〉講的是文字模型,聲音這塊其實是同一個邏輯:這份資料我不想丟出去,那就讓模型進來。

本機聲音克隆的 3 個好處:聲音樣本不上雲、重配不扣點數、6 段旁白 3 分鐘生完
本機跑的三個理由(本站自製資訊圖)

聲音克隆免費 3 步驟:Voicebox 怎麼用

裝 app、錄一段樣本、貼文字生成,三步就結束。沒有指令列、不用裝 Python,Voicebox 官方就是衝著「像 ElevenLabs 那樣好用,但免費在本機跑」做的。

  1. 下載安裝 Voicebox,在 app 裡下載 Qwen3-TTS 模型。官方下載點是 voicebox.sh(Mac 給 DMG、Windows 給 MSI)。開 app 後選引擎,Qwen3-TTS 有 0.6B 和 1.7B,我用 1.7B,聲音比較像本人;電腦比較弱就先試 0.6B。
  2. Create Voice:錄或匯入一段自己的聲音。找安靜的地方、用平常講話的語速唸一段,不要唸廣播腔。Qwen3-TTS 官方說 3 秒就能克隆,但 Voicebox 支援放多段樣本提高品質,我建議多錄幾段、涵蓋不同語氣。
  3. 貼文字、選中文、生成,匯出 wav。生完先自己聽一遍。遇到它唸不順的詞,我的習慣是直接改稿(例如「本週」改成「這禮拜」),比重配十次快。
聲音克隆 3 步驟:下載 Voicebox 並選 Qwen3-TTS 模型、錄一段自己的聲音建立聲音檔、貼文字生成並匯出 wav
三步驟流程(本站自製資訊圖)

建聲音檔的時候有一格「描述」可以填,我寫的是「有精神熱情的企業講師、語速適中、台灣人」。這一格對聲音本身沒什麼影響,克隆出來的腔就是你樣本的腔——我講台灣腔,成品就是台灣腔,不用特別找「台灣口音」的選項。

我踩了 4 個月的坑:語氣參數根本沒作用

Voicebox 的 API 有一個「語氣指示」欄位,我用了 4 個月,後來才發現在我的 Mac 上它從頭到尾沒生效。這件事很值得講,因為它不只是這套工具的問題,是用任何 AI 工具都會遇到的狀況。

事情是這樣:我做短影音時,每一頁旁白都會帶一句語氣指示,像「這段講得興奮一點」「這段語氣沉一點」,覺得成品有氛圍感。9 月 17 日那天我做了一個盲測,同一句話生一個興奮版、一個悲傷版,兩個聽起來一模一樣。我追問了一句「你有到 GitHub 上查過嗎」,翻源碼才發現:Apple Silicon 的 Mac 會走 MLX 後端,那條路收了這個參數,但沒有傳給模型。

所以 4 個月的「氛圍感」全是自己腦補的。教訓只有一句:API 有那個欄位,不等於那個欄位有作用。以後我說某個工具「有支援」什麼功能之前,會先做一次盲測,聽不出差別就去看源碼,而不是看文件寫了什麼就信。

用之前先想清楚的 3 件事

只克隆自己的聲音、樣本自己保管好、每次生完都親耳驗收。好用歸好用,這東西的門檻已經低到 3 秒音檔就能克隆,反過來說,任何人拿到你 3 秒的乾淨錄音也做得到。

  1. 只克隆自己的、或明確同意的聲音。拿家人朋友的聲音「玩玩看」都不要。之前寫的〈AI 詐騙怎麼防?聽到家人的聲音先掛掉,警方 3 個動作+一組專屬密語〉就是這項技術的另一面,你自己會用,代表詐騙集團也會。
  2. 聲音樣本跟聲音檔留在本機就好。這也是我選本機工具的主因,不用把樣本交出去。
  3. 每次生完自己聽一遍。模型會唸錯字、會把數字唸得很怪,發出去之前一定要驗收;覺得某個參數有效果,先盲測再相信,我那 4 個月就是沒做這步。
聲音克隆用之前的 3 件事:只克隆自己或同意的聲音、樣本留在本機、每次生成後親耳驗收並盲測參數
用之前的三件事(本站自製資訊圖)

小結

50 幾支短片下來,我最有感的不是「AI 聲音好像真人」,而是省下來的錄音時間全部回到內容本身:稿子改十次、旁白就重生十次,不用再開麥克風。三步驟裝起來不用半小時,真正花時間的是「驗收」這步,別省。

你有想過用自己的聲音做什麼嗎?影片旁白、給小孩的睡前故事、還是幫自己的簡報配音?留言告訴我,我下一篇挑一個來實作。


延伸閱讀

本文工具資訊整理自官方專案頁:Voicebox(GitHub,MIT)Qwen3-TTS(GitHub,Alibaba Cloud Qwen 團隊,2026-01-22 發布);使用心得與數字是我自己 2026 年 5 月到 9 月的實際使用紀錄。

留言