Voice-Pro:把 Whisper 和語音克隆串成本機全自動 AI 配音管線

Voice-Pro 是 11k 星的 GPL-3.0 開源工具,把 Whisper 語音辨識、語音克隆、AI 配音串成一條本機全自動管線。本文依官方文件拆解它的 tech stack、一鍵安裝流程、與 ElevenLabs 的差異,以及 Windows-only+NVIDIA GPU 的硬限制。

用 AI 摘要這篇文章:

Voice-Pro 是一套裝在你 Windows 電腦上的 AI 配音工作流。你丟給它一支 YouTube 連結或一段影片,它會把影片裡的人聲抽出來、轉成文字、翻譯,再用原本那個人的聲音(或你指定的聲音)重新配音成另一種語言。整件事在你自己的顯卡上跑完,不用每個月付訂閱費,素材也不用上傳到雲端。

它把這整條流程收進一個網頁介面(Gradio WebUI),打開瀏覽器就能操作,背後串的全是開源圈已經成熟的模型,例如 Whisper 做聽寫、F5-TTS 跟 CosyVoice 做語音克隆、Demucs 做拆人聲。說白一點,它不是新發明,而是把這幾個本來要自己寫 Python 才串得起來的工具,包成一般人點兩下滑鼠就能啟動的一鍵包。專案在 GitHub 上累積超過 1.1 萬顆星,最新版是 v4.0.0。

這篇要回答三個問題:它到底做什麼、跟 ElevenLabs 這類雲端配音服務差在哪、值不值得你花一個晚上裝起來。先把話講清楚:我只讀了它的 repo README 跟授權欄位,沒有實際跑過。它是 Windows-only、需要一張 NVIDIA 顯卡的工具,我在 macOS 上裝不起來,所以底下講的是「README 寫到什麼」加上「這類工具的常識判斷」,不是實測結果。克隆出來的聲音像不像、跟商用服務差多少,README 沒給基準,我也沒辦法替它背書。

Voice-Pro 處理管線:YouTube/影片→Demucs 分離→Whisper 辨識→翻譯→F5-TTS 克隆→配音輸出。Pin
Voice-Pro 處理管線:YouTube/影片→Demucs 分離→Whisper 辨識→翻譯→F5-TTS 克隆→配音輸出。

Voice-Pro vs ElevenLabs 規格比較表Pin
Voice-Pro(本機免費)vs ElevenLabs(雲端付費)規格比較。

跟 ElevenLabs 的差別:免費,但你要自備顯卡跟 Windows

README 第一段就寫它自己是「A robust alternative to ElevenLabs」(ElevenLabs 的強力替代品)。這句是作者自己說的話,你要先理解它「替代」到底替代了什麼、代價是什麼。

ElevenLabs 是雲端訂閱制服務。你上傳聲音樣本,它用很成熟的模型幫你克隆聲音、生成配音,按字元或分鐘計費。優點是開箱即用、品質穩、瀏覽器打開就能用;缺點是要錢、素材要上傳到對方伺服器、處理量大時成本會疊上去。

Voice-Pro 走的是相反的路。模型全部裝在你電腦上,跑完不算錢,檔案不離開你的硬碟。但你付出的代價是:

  • 要有一台 Windows 電腦加一張 NVIDIA 顯卡(官方建議顯存 8GB 以上)。
  • 要騰出 20GB 硬碟空間,第一次啟動要等它下載大約 10GB 的模型檔。
  • 要自己承擔品質不穩的風險。README 沒給任何跟 ElevenLabs 的品質對比數字,所以我沒辦法告訴你克隆出來的人聲像不像、或跟商用服務差多少。

換句話說,它替代的是「固定成本」這件事:你把每個月的訂閱費,換成一次性的顯卡成本跟設定時間。如果你的工作量很大(例如每週都要配好幾小時的影片),這個交換通常比較值得;如果你一個月才配一支短片,直接用雲端服務往往省事得多。

四個分頁搞定下載、字幕、翻譯、配音

WebUI 用 Gradio 搭的。Gradio 是 AI 圈常用來快速做機器學習網頁介面的工具,打開瀏覽器就能操作,不用寫前端。v4.0 把介面升級到 Gradio 6,所有分頁改用全寬度版面,字幕軌會直接顯示在影片播放器裡,一邊播一邊看得到對應文字,不用再切到另一個視窗對照。README 公開的截圖顯示它分成四個主要分頁:

  • Dubbing Studio(配音工作室):這是主戰場。從 YouTube 連結下載、用 Demucs 拆出純人聲、用 Whisper 聽寫成字幕、翻譯、再生成配音,一條龍在同一個分頁跑完。支援所有 ffmpeg 相容的影音格式(ffmpeg 是處理影片音訊的萬用工具,幾乎所有格式都吃得進去),輸出可以存成 WAV、FLAC 或 MP3。
  • Whisper Caption(聽寫字幕):焦點放在純字幕生成,支援 90 多種語言,有單字級(word-level)高亮跟去噪選項。如果你只想要字幕檔不配音,用這個。
  • Translate(翻譯):處理 100 多種語言,可以直接吃字幕檔(ASS、SSA、SRT 這些常見格式都行),也能做即時語音辨識再翻譯。
  • Speech Generation(語音生成):純文字發音分頁,讓你挑 Edge-TTS、F5-TTS、CosyVoice 或 kokoro 任一個模型,把文字直接念成聲音,不做克隆。

這四個分頁其實對應四種使用情境:你要從頭到尾一條龍、你只缺字幕、你只缺翻譯、你只缺配音。好處是你不用為了配一句話跑完整條 YouTube 下載流程;壞處是分頁之間不會自動接力,某些步驟要自己手動把檔案丟來丟去。如果你還缺一套剪輯工具先把素材剪好,可以先看影片剪輯軟體推薦;Voice-Pro 本身不做剪接,只管聲音這一段。

底層是你要認識的那幾個開源模型

這部分是理解 Voice-Pro 的關鍵。它不是一家公司從零訓練出來的模型,而是把開源圈已經跑得很穩的幾個工具串起來。你認得這幾個名字,就大概知道它的能力上限在哪。

聽寫(語音轉文字,簡稱 STT)

用 OpenAI 開源的 Whisper 家族。Voice-Pro 整合了原版 Whisper、Faster-Whisper(速度優化版)、Whisper-Timestamped(加時間軸版),v4.0 預設用 Faster-Whisper 1.2.1,模型可選 large-v3-turbo 或 distil-large-v3.5。Whisper 是目前開源圈最通用的語音聽寫模型,支援多語言,連不太標準的口音都能聽懂個七八成。

語音克隆(用一段參考音檔模仿那個人的聲音)

用 F5-TTS(v1.1.21)、E2-TTS、CosyVoice,新版還加了 Fun-CosyVoice3-0.5B(支援包含韓文在內的 9 種語言)。這幾個都是零樣本(zero-shot)克隆,也就是你不用先訓練模型,只要給它一段幾秒到幾十秒的參考音檔,它就試著用那個聲音念出你餵給它的文字。

純文字發音(TTS,不做克隆)

用 Edge-TTS 跟 kokoro。Edge-TTS 走的是微軟 Edge 瀏覽器朗讀功能背後的免費介面,號稱支援 100 多種語言、400 多種聲音;kokoro 則是 README 寫它在 HuggingFace TTS Arena 排名第二。這條路不需要參考音檔,直接挑一個預設聲音念。

拆人聲跟下載

Demucs(Meta 開源的音樂分離工具)負責把影片裡的人聲跟背景音樂分開,yt-dlp 負責從 YouTube 抓影片。這兩個都是各自領域的標準工具,被廣泛用在各種音訊專案裡。

模型大小跟品質的取捨

README 的 Tips 段寫了幾個直接影響成品的好理解原則。字幕品質通常跟著 Whisper 模型大小走,順序是 large 大於 medium、small、base、tiny,但不是絕對,偶爾小模型在乾淨錄音上反而夠用。運算類型(Compute Type)選 float 品質較好但吃顯存,選 int 是把模型量化壓縮,省顯存也跑得快,但品質會掉一些。Demucs 的去噪等級(Denoise level)調高會拆掉更多背景音,只留下純人聲給 Whisper 聽,但 README 明講這「不保證結果更好」,有時反而把有用的聲音線索一起拿掉。這幾個旋鈕之間沒有最佳解,要根據你的素材跟顯存用量自己試。

看懂這層之後,你就知道 Voice-Pro 的能力上限其實等於這幾個模型的上限。它的價值不在「發明了更強的 AI」,而在「把這幾個本來要寫程式才能串起來的工具,包成一般人也點得動的網頁」。

怎麼裝:下載、configure.bat、start.bat 三步

Voice-Pro 走的是一鍵啟動包路線,不裝在虛擬環境裡、不碰系統 Python。README 寫的流程是這樣。

先確認硬體

  • 作業系統:Windows 10/11(64 位元)。README 在系統需求欄雖然列了 Linux 跟 Mac Apple Silicon,但另一段又明講「只在 Windows 加 NVIDIA 顯卡上驗證過,Mac 跟 Linux 沒測」,所以實際要裝就當它是 Windows 專用。
  • 顯卡:NVIDIA,驅動 570 以上(支援 RTX 50 系列)。CUDA Toolkit 不用自己裝,v4.0 之後 PyTorch 已經把 CUDA runtime 包進去了。
  • 顯存(VRAM):最低 4GB,建議 8GB 以上。想用 Demucs 最高去噪等級(level 2),至少要 8GB。
  • 硬碟:20GB 以上。第一次啟動會下載大約 10GB 的模型檔。
  • 不需要管理員權限(v4.0 起)。

三個檔案搞定

1. 從 GitHub releases 下載最新版(v4.0.0)的 Source code zip,解壓縮。跟大多數 Windows 上的 Python GPU 專案一樣,建議裝在英文路徑下,省得日後 debug。

2. 跑 configure.bat(可選)。這一步會設定系統的 git 跟 ffmpeg,需要管理員權限,跑一次就好。沒有管理員權限就跳過,start.bat 會自己抓可攜版的 ffmpeg。

3. 跑 start.bat。第一次啟動會做三件事:先用 uv(一套新的 Python 套件管理器,比傳統 pip 快很多)下載 Python 3.12 跟所有依賴,再下載 AI 模型(這是最慢的一步),最後打開瀏覽器連到 http://127.0.0.1:7870

README 寫依賴安裝是「分鐘級不是小時級」,但那 10GB 的模型下載才是真正的瓶頸,取決於你的網路速度。裝好之後,之後每次啟動只要再跑一次 start.bat 就好。v4.0 另一個值得一提的改動是安裝器從 Miniconda 換成 uv,好處是安裝可重現,整份依賴鎖在 uv.lock 裡,不同機器裝出來的環境一致,也比較不會踩到版本衝突。

GPU 模式跟疑難排解

start.bat 會自動偵測你用 GPU 還是 CPU。如果偵測不準,可以設環境變數 GPU_CHOICEG 代表 NVIDIA、C 代表 CPU)強制指定,或把 installer_files\gpu_choice.txt 刪掉讓它重判。README 給的通用救火招是:遇到怪問題就把 installer_files 資料夾整個刪掉再跑一次 start.bat,等於乾淨重裝,幾分鐘搞定,而 model/ 裡已經下載的模型會保留,不用重抓。錯誤訊息會以紅色提示停在 WebUI 上,直到你手動關掉,不會一閃即逝。

更新跟移除

update.bat 會重新把 Python 環境同步到 lockfile 版本。uninstall.bat 負責移除,v4.0 起不用管理員權限、也不會強制重開機;加上 silent 參數可以靜默移除。移除只砍 installer_files 資料夾,你下載的模型(model/)跟作品(workspace/)會保留下來,下次重裝不用重抓模型。

裝之前要先接受的幾個限制

這幾項會直接決定你能不能用,先看清楚再下載:

  • 只驗證過 Windows。README 自己承認 Mac 跟 Linux 沒測過,就算你在系統需求欄看到 Mac Apple Silicon,也別指望它能在 macOS 上順利跑起來。你手邊只有 Mac 的話,這工具基本跟你無緣。
  • 一定要 NVIDIA 顯卡。沒有 N 卡跑不動。start.bat 雖然會自動偵測,也能強制走 CPU 模式,但 CPU 模式慢到不實用,只能當應急。AMD 或 Intel 顯卡不在支援範圍。
  • 顯存決定能做多少事。4GB 只能跑基本功能;想用 Demucs 最高去噪、或跑大模型克隆,要 8GB 以上。README 自己給的解法是 CUDA 顯存不夠時,把 Denoise 調到 0 或 1、Compute Type 改成 int(用一點品質換顯存空間)。
  • 第一次設定要等。模型下載 10GB 起跳,網路不快會等上一段時間。裝好後模型存在 model/ 裡,不用重抓。
  • 翻譯吃 Google 免費額度。預設用 Deep-Translator,走的是 Google 的免費翻譯網頁端點。README 明講這個端點在公司網路或防火牆後面常被限速或擋掉,長字幕翻到一半會失敗。它的退路是失敗時保留原文並重試,但如果你要大量翻譯又人在企業網路,作者建議改用自己的 Azure Translator key(要另填 .env)。

授權跟專案狀態,要先看清楚

兩件事會影響你的長期決定。

授權

GitHub repo 的授權欄位標示為 GPL-3.0(開源,可免費使用、可修改、可散布)。你可以合法把它裝在公司電腦上、改來自己用。不過要注意 GPL 類授權的傳染性:如果你改了程式碼再散布出去,你的版本也得用相同授權開源。單純自用沒這個問題。

專案目前停滯

README 兩處(Please Note 跟 Notice)都寫:因為開發團隊跑去開發另一個叫 WeConnect 的產品,Voice-Pro 暫時不會更新,所有程式碼已經開源,歡迎任何人接手修改。最新版 v4.0.0 的最後更新日期是 2026-07-13。對你的意義是:這不是一個還在活躍迭代的產品,bug 要靠你自己或社群處理,模型版本會停在現在這個樣子(除非有人 fork 接手)。優點是程式碼全開放、不會跑路;缺點是別指望下個月就支援新模型。

名人聲音克隆的法律灰區

README 列了一長串內建的名人參考聲音(Joe Rogan、Elon Musk、Trump、各國影星歌手等)。這些是給你做語音克隆的範本。技術上能做,不代表法律上可以做。未經本人同意克隆公眾人物的聲音拿去做公開內容,在很多國家已經踩到肖像權、聲紋權或不正競爭的紅線。自己練習或做不公開的測試是一回事,做成公開影片發布又是另一回事,後者的風險你自己扛。

誰適合裝、誰算了吧

裝得起來又真的會省到錢的人大概是這種:你有一台 Windows 加 NVIDIA 顯卡的桌機,每週或每月都要處理一定量的多語言配音或字幕工作(例如做 YouTube 多語頻道、把教學影片配成英文、處理訪談聽寫),而且你不願意每個月付雲端訂閱費。對你來說,一次花一個晚上裝好,之後每跑一分鐘都是免費的,這個交換相當值得。

不適合的人:只有 Mac 的人(裝不起來);只偶爾配一支短片的人(設定成本蓋不過雲端訂閱);需要把成品商業發布又不想碰授權跟法律灰區的人;以及期待「一鍵完美克隆」的人(README 沒給品質保證,你自己要測一次)。

如果你想找的是把已經拍好的影片畫質拉高的工具,這不是它,往 HitPaw Video Enhancer 那類去看;如果是影片轉檔的需求,HitPaw Video Converter 比較對口。Voice-Pro 顧名思義只做聲音這一段。

第一步很簡單:去它的 GitHub repo 下載 v4.0.0 的 Source code,解壓縮,跑 start.bat,等它裝完。能不能用、克隆出來像不像,你自己跑一支短影片試一次最準,這也是 README 沒講、我也沒辦法替你回答的那一部分。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 736

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...