Voicebox:在自己電腦上跑的開源 AI 語音工作室

Voicebox 是一款開源(MIT)的 AI 語音工作室,支援語音克隆、文字轉語音與聽寫輸入,全部在自己的機器上跑,不必上傳聲音資料到雲端。模型下載後完全離線、零遙測,是 ElevenLabs 的免費本地替代。

用 AI 摘要這篇文章:

做影片、做播客的人多半聽過 ElevenLabs,它的 AI 語音合成效果確實好,但按字元收費的模式,稍微改幾個字就燒掉幾美金;而且把自己的聲音樣本傳到別人的雲端伺服器,心裡總覺得不踏實。Voicebox 走的是完全不同的路線:它是一套開源的 AI 語音工作室,讓你在自己的電腦上完成語音克隆、文字轉語音、聽寫輸入等全部工作,聲音資料留在本機、收費也歸零,這對高頻產出語音的人來說尤其有吸引力。

這款專案在 GitHub 上衝破了四萬顆星,是近期開源圈最受關注的本地語音工具之一。它不只是一個簡單的文字轉語音引擎,而是把自己定位成一整套「語音輸入與輸出的工作流」:從克隆你的聲音、用文字生成語音,到把語音聽寫進任何應用程式,全部在自己的機器上跑。下面把它的實際能力、本地架構的誠實拆解、與 ElevenLabs 的定位差異,以及使用前該知道的事一次講清楚,讓你在決定是否要把這套工具放進自己的語音工作流之前,有充分的資訊可以判斷。

Voicebox GitHub 倉庫頁面,顯示 MIT 開源語音工作室專案Pin
Voicebox 的 GitHub 倉庫,MIT 授權、TypeScript、四萬多顆星。

它實際能做什麼

Voicebox 的功能圍繞著「聲音的輸入與輸出」展開。在輸出端,它能把你輸入的文字轉換成自然語音,而且支援克隆你自己或授權對象的聲音,讓生成的語音帶有你熟悉的音色與節奏,而不只是千篇一律的機器人聲。在輸入端,它提供聽寫功能,讓你用語音對任何應用程式做文字輸入,等於把系統內建的語音聽寫升級成可自訂聲音模型的版本。

跟市面上多數開源 TTS 工具相比,Voicebox 的差別在於它把這些功能整合成一個完整的工作室介面,而不是只給你一個輸入框、一次生成一句話。它的定位是「語音生產工作流」,讓你在一個介面裡管理聲音模型、生成紀錄、聽寫設定,就像一套聲音版的剪輯軟體。對需要頻繁產出語音內容的人來說,這種工作流取向比單次生成的工具更實用。舉例來說,你可以先克隆自己的聲音建立一個專屬模型,之後每次輸入文字就自動用你的音色朗讀;也可以為不同角色建立不同的聲音模型,在同一個專案裡切換使用,就像在剪輯軟體裡切換音軌一樣自然。對做有聲書或角色廣播劇的人來說,這種多聲音模型管理是單次 TTS 工具做不到的。

Voicebox 官方網站首頁,展示語音工作室介面與下載入口Pin
Voicebox 官方網站 voicebox.sh,提供桌面版下載。

本地跑、不上雲

Voicebox 最核心的賣點是「本地」。它的語音模型、聲音樣本、生成紀錄全部存在你自己的機器上,運算也在本地完成,不必把任何聲音資料上傳到外部伺服器。從原始碼來看,從原始碼看,找不到任何分析或遙測 SDK,推論全部在本機完成,模型在你的 CPU 或 GPU 上跑,生成結果直接寫回本地磁碟。這意味著,只要模型下載完成,斷網它照樣能正常使用,你的聲音資料始終只有你自己碰得到。這種「零遙測」的設計,對特別在意隱私的人來說是很實在的保證:它的隱私保證直接寫在原始碼裡,會回報使用行為的程式碼根本沒放進專案,你可以自己 clone 下來檢查、甚至移除任何你不安心的部分,這正是開源工具在隱私面的根本優勢。

不過有一個前提要說清楚:剛開始使用時,Voicebox 需要從網路下載語音模型檔案,這些模型通常體積不小。下載完成之後,後續的生成與聽寫都在本地進行,不再需要網路。所以它的「離線」是指模型下載完之後的穩態,而不是從安裝的第一秒就完全斷網。這和多數本地 AI 工具的模式一致。和 FreeFlow 這類本地語音工具 不同的是,FreeFlow 的聽寫仍需把音檔送到雲端模型做推論,而 Voicebox 的模型就在你的機器上,不必外送。

跟 ElevenLabs 比起來

把 Voicebox 放到 ElevenLabs 旁邊看,會更清楚它的定位。ElevenLabs 是一套成熟的商業雲端服務,語音品質高、支援的語言與聲音庫豐富,但按字元收費,而且你的文字與聲音樣本都要經過它的伺服器。Voicebox 走的是開源、免費、本地的路線,代價是它的語音品質與成熟度目前還在發展中(版本仍在 v0.5.x),而且需要你自己下載模型、占用自己的運算資源。

換句話說,ElevenLabs 收費、代管運算,換來開箱即用的穩定品質與豐富的語音庫;Voicebox 不收費、不上傳,代價是品質與成熟度還在追。如果你做的是商業級的專業配音,需要最高品質與最少麻煩,ElevenLabs 仍然比較穩當;但如果你在意隱私、不想持續付費、或者想在自己的機器上打造一套完全可控的語音工作流,Voicebox 提供了一個值得追蹤的開源方向。它也可以和 Text2Voice 這類邊緣 TTS 工具 放在同一個工具箱裡,各自負責不同層級的語音需求。Text2Voice 走的是輕量雲端路線(透過 Edge TTS 介面),Voicebox 則把整套模型搬上你的機器,兩者的取捨在於「便利 vs 隱私」與「雲端 vs 本地」,看你最在意哪一端來選擇。

語音克隆的倫理邊界

Voicebox 的語音克隆功能很強大,但強大的工具也伴隨責任。克隆別人的聲音需要對方的同意,未經授權複製他人的聲音用於公開內容,可能涉及肖像權與個資法的問題。在台灣,利用他人聲音進行不實表述,可能觸及民法的名譽損害與個人資料保護法的規範。工具本身是中性的,怎麼使用取決於使用者,但在動手克隆任何聲音之前,先確認你擁有合法的授權或對方的同意,是使用這類功能的基本底線。此外,使用 AI 克隆聲音產出的內容,如果對外發布,也建議主動標註「本語音由 AI 合成」,讓聽眾知道這不是真人原聲,這不只是倫理上的善意,在越來越多國家研擬規範合成媒體揭露的趨勢下,也可能成為未來的法規要求。把這些倫理與法律面向放進考量,負責任地使用語音克隆技術,才能讓這類強大的工具發揮正面價值,而不至於造成傷害或爭議。

適合誰用

Voicebox 最適合的,是經常需要產出語音內容、在意聲音資料隱私、而且願意花時間在自己機器上設定模型的創作者與開發者。如果你做影片配音、播客旁白、或有聲書,而且不想逐字付費、或把聲音樣本外送給雲端服務,它提供了一個完全免費、完全本地的替代方案。搭配 瀏覽器本機音訊轉文字工具 等其他本地語音工具,就能把整個語音工作流都收進自己掌控的環境裡。特別是那種需要長期、大量產出語音內容的情境(例如每週更新播客、為 YouTube 影片配音),用本地免費工具取代按字元收費的雲端服務,長期累積下來的成本差距相當可觀,而隱私面的安心感更是雲端服務難以提供的。

相對地,如果你需要的是最高品質、最少設定的語音合成,而且不在乎雲端成本與隱私,那 ElevenLabs 這類成熟商業服務仍然更省事。Voicebox 目前仍在快速發展中,把它當成一個值得追蹤、可以提早參與的開源專案,會比期待它立刻取代成熟商業方案更實際。以它目前的發展速度(四萬多顆星、近期持續推送更新),未來能否逐步逼近商業服務的品質,值得持續觀察,也值得提早加入、跟著它一起成長。

面向VoiceboxElevenLabs
授權MIT 開源、免費商業閉源、按字元收費
運算位置本地(CPU/GPU)雲端伺服器
聲音資料存在本機、不上傳上傳至雲端處理
遙測有(商業服務)
成熟度v0.5.x 發展中成熟商用
適合在意隱私、不想付費的創作者需要最高品質、願意付費的專業用戶
Voicebox 與 ElevenLabs 的定位對照。

系統需求與安裝

要跑 Voicebox,你需要一台有一定運算能力的機器。語音模型的推論需要 CPU 或 GPU 資源,模型檔案本身也占磁碟空間(通常數 GB)。它提供桌面版安裝包,可以從 GitHub 的 Release 頁面或官方網站 voicebox.sh 下載,支援的主要平台涵蓋 macOS、Windows 與 Linux。安裝後打開應用程式,依照引導下載所需的語音模型,就能開始使用。整個安裝過程不需要命令列操作,對不熟悉開發工具的使用者也相當友善。

如果你的機器沒有獨立顯示卡,Voicebox 仍可用 CPU 推論,但生成速度會比 GPU 慢。對於只是偶爾生成幾段語音的使用者,CPU 模式通常可以接受;但如果你需要大量、批次地產出語音內容,一張支援 CUDA 或 Metal 的 GPU 會讓體驗順暢得多。建議在下載前先確認你的硬體規格,避免模型裝好了卻跑不動的窘境。另外,由於模型檔案通常有好幾 GB,下載前也要確認磁碟空間充足;如果你住在網路較慢的地區,初次下載可能需要相當長的等待時間,建議挑一個不用急著用的時段再開始。

常見問題

Voicebox 是完全離線的嗎? 模型下載完成後是離線的。剛開始需要從網路下載語音模型,之後的生成與聽寫都在本地進行,不需要網路。

Voicebox 是開源的嗎? 是,MIT 授權,原始碼在 GitHub 完整公開。你可以自由使用、修改、自架。它也歡迎社群貢獻,有興趣參與開發的人可以直接到倉庫提交 issue 或 pull request。

它會上傳我的聲音資料嗎? 不會。聲音樣本、模型、生成紀錄都存在你自己的機器上,原始碼中也沒有埋入遙測或分析 SDK,不必擔心資料外送,這是它相較於雲端服務最根本的隱私優勢。

它的語音品質比得上 ElevenLabs 嗎? 品質仍在發展中(版本 v0.5.x),目前不宜直接宣稱與 ElevenLabs 平起平坐。ElevenLabs 是成熟的商業雲端服務,品質穩定;Voicebox 走的是免費本地路線,賣點是隱私與成本,品質成熟度則還在追,可以期待後續版本帶來更好的表現。

克隆別人的聲音合法嗎? 需要對方同意。未經授權克隆他人聲音可能涉及肖像權與個資法問題,使用前務必確認你有合法授權。在台灣,未經同意使用他人聲音可能涉及民法侵權與個人資料保護法,建議在使用克隆功能前先了解相關法律規範,必要時也可以尋求法律專業意見,確保自己的使用方式不會觸法。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 688

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...