ClearerVoice-Studio 開源語音工具包,去噪與人聲分離筆電就能跑

ClearerVoice-Studio 是阿里巴巴語音實驗室開源的 AI 語音處理工具包,去噪、人聲分離、升頻一次包辦;實測在筆電 CPU 上就能跑得動,但主程式碼已凍結一年多、兩個 HuggingFace 演示雙雙掛掉,想用之前先看清維護現況。

用 AI 摘要這篇文章:

先講結論:ClearerVoice-Studio 值得裝,但你要知道拿到手的東西停在 2025 年 8 月。這套由阿里巴巴語音實驗室開源的語音處理工具包,核心功能到今天都裝得起來、跑得動,我在沒有獨立顯卡的 Apple Silicon 筆電上把去噪、分離幾種任務全部跑過一輪,處理速度都快過音檔本身的長度;但它的兩個官方線上 Demo 已經雙雙掛掉、主程式碼凍結超過一年、社群修好的程式碼堆在門口沒人收。一句話:跑自己的一次性清理任務很值得,要當成長期依賴的基礎建設,先看完整篇再決定。

它在 GitHub 上有 4,500 多顆星,採 Apache-2.0 授權,能做的事情圍繞著四類語音任務:把帶噪音的錄音變乾淨(語音增強)、把兩個人同時講話的音檔拆成兩軌(語音分離)、把低取樣率的語音拉到 48kHz(超解析),以及從混合音場裡指定抽出某個說話的人(目標說話人提取,其中一個子任務甚至支援用嘴唇影像或腦電訊號當線索)。

這套工具包裡面裝了什麼

ClearerVoice-Studio 不是單一模型,而是三個部件的組合:ClearVoice 是推理入口,載入預訓練模型直接處理音檔;Train 是給研究者的微調訓練腳本;SpeechScore 則是一組語音品質評分指標(SNR、PESQ、STOI、DNSMOS 這類),官方自己的評測數字就是用它算出來的。三個部件共用一個 repo,各有一份說明文件。

先把幾個容易混淆的名詞用一句話講清楚。語音增強指的是把噪音壓掉、讓人聲變清楚,輸入輸出取樣率不變;語音分離是混合音檔裡同時有好幾個人講話,把它拆成每人一軌;超解析是升頻,把 16kHz 等級的語音內容補到 48kHz 的頻寬,救的是聽感細節而不是清晰度;目標說話人提取則是在混合音場裡指定「只要這個人」,線索可以是另一段參考語音、一段嘴唇影片,研究方向的子任務甚至支援用腦電訊號當條件。任務之間共用模型家族,所以訓練腳本目錄才會長出一整排子資料夾。

推理入口目前對應的預訓練模型如下:

任務模型權重大小
語音增強(16kHz)FRCRN_SE_16K、MossFormerGAN_SE_16K161MB、136MB
語音增強(48kHz 全頻段)MossFormer2_SE_48K222MB
語音分離(16kHz)MossFormer2_SS_16K670MB
語音超解析(升至 48kHz)MossFormer2_SR_48K兩個權重檔合計約 440MB
目標說話人提取(視聽融合)AV_MossFormer2_TSE_16K約 735MB

模型權重第一次執行時自動從 HuggingFace 下載,之後留在本機快取,也可以手動從 ModelScope 下載。支援的輸入格式涵蓋 WAV、FLAC、MP3、M4A、OGG、OPUS 等常見類型,單聲道與雙聲道、16 與 32 位元深度都吃,非 WAV 格式靠系統的 FFmpeg 轉檔。出身方面,README 自己署名是 Alibaba Group 智能計算研究院的語音實驗室,聯絡信箱是 alibaba-inc.com 網域,團隊也在 2025 年 6 月發過一篇說明整體設計的論文,論文裡的定位講得很直白:不像 SpeechBrain、ESPnet 那種什麼都包的大型平台,專注在語音增強、分離、超解析與多模態說話人提取這幾件互相關聯的任務上。

這套包裝的底層模型早在工具包出現前就已經在被大規模使用:ModelScope 上的 FRCRN 語音降噪模型頁面顯示約 692 萬次下載,MossFormer 語音分離模型約 271 萬次,截至 2026 年 10 月。凍結的是包裝與工程層,模型本身經過大量實戰。整個 repo 的提交紀錄也很有辨識度:超過三百次提交幾乎全來自兩位署名作者,是典型的實驗室內部專案形態,而不是開放社群共同維護的基金會型專案,這點先記著,下面談維護時會用到。

GitHub 上 modelscope/ClearerVoice-Studio 儲存庫頁面,顯示 4.5k 星與檔案列表,最新提交停在 2025 年 8 月Pin
ClearerVoice-Studio 的 GitHub 頁面(2026-10):4,531 顆星、Apache-2.0 授權,檔案列表顯示最後一次提交標記為 last year。

我在筆電上實際跑出來的數字

安裝只有一行:pip install clearvoice。我在 Python 3.11 的乾淨虛擬環境裡裝 0.1.2 版,連同 PyTorch 在內的全部相依套件一次成功,全程 56 秒,沒有碰到任何需要編譯器的環節。四種任務的實測結果如下(Apple Silicon 筆電、純 CPU、2026-10 實測):

任務模型輸入CPU 耗時輸出
去噪FRCRN_SE_16K2.4 秒 WAV2.33 秒同長度 16kHz 單聲道
去噪FRCRN_SE_16K18.5 秒 MP34.51 秒同長度(內容仍為 MP3)
增強MossFormer2_SE_48K25.6 秒、48kHz 陣列1.89 秒同長度 48kHz
分離MossFormer2_SS_16K4.4 秒雙人混合1.12 秒兩軌各 4.4 秒

有兩個細節讓我確認處理是真的發生了,而不是原檔穿過去:輸入與輸出的波形相關係數是 0.954,差異訊號的振幅約是原始訊號的三成(能量比約 9%)。輸出檔的長度、取樣率、聲道數都與輸入一致,分離任務則照著混合音檔裡的人數輸出兩軌各自完整的音檔。音質聽起來變好多少,這我沒有立場替你判斷,能跟你保證的是處理真實發生、時間成本大概多少;官方評測表中 48kHz 增強模型在 VoiceBank+DEMAND 測試集的 PESQ 分數高於 Resemble Enhance 與 DeepFilterNet 兩個開源同行,那是官方統一模型跑出來的數字,僅供參考。

第一次跑的隱形成本是權重下載:我實測的 FRCRN 模型 161MB,下載連同載入花約 30 秒,之後全走本機快取,第二次起就是純推理時間。另外兩個大模型(超解析與視聽提取)的儲存庫裡還附了訓練狀態檔,首次下載量會比表列的權重數字更大。輸入也支援一整個資料夾或純文字清單檔,清單模式搭配 online_write=True 會邊處理邊寫檔,適合一次丟幾十個訪談錄音進去放著跑。

程式介面本身很省事,三行就能跑完一個檔案:

from clearvoice import ClearVoice

cv = ClearVoice(task='speech_enhancement', model_names=['FRCRN_SE_16K'])
output = cv(input_path='input.wav', online_write=False)
cv.write(output, output_path='output.wav')

task 從 speech_enhancement、speech_separation、target_speaker_extraction 三個值裡選,model_names 可以一次指定多個模型比對輸出,輸入可以是單檔、整個資料夾或清單檔。只吃 WAV 的話連 FFmpeg 都不用裝;MP3、M4A、OGG 之類的格式才需要系統裡有 FFmpeg,我餵 18.5 秒的 MP3 進去就是走這條路。

想先在瀏覽器試用,入口只剩一個

README 頂端掛了兩個 HuggingFace 展示連結,ClearVoice 與評分工具 SpeechScore 各一個,目前兩個都是 RuntimeError 狀態。ClearVoice 那個的死因頁面上看得一清二楚:示範環境釘住的 gradio 版本呼叫了新版 huggingface_hub 已經移除的 HfFolder,一連串 import 在開機階段就斷掉。這不是什麼深奧的模型問題,就是展示環境沒人跟著相依套件更新,放到爛掉了。兩個展示空間的最後更新時間分別停在 2025 年 7 月與 2024 年 11 月,對照主 repo 凍結在 2025 年 8 月,時間軸是完全一致的:整個專案的對外門面在同一個夏天之後就靜止了。

HuggingFace 上 ClearVoice 演示空間的 RuntimeError 頁面,錯誤訊息顯示 import gradio 時的 ImportErrorPin
HuggingFace 版 ClearVoice 演示的現況(2026-10):容器開機即因 ImportError 中止,死因是相依套件版本漂移。

還能用的官方入口在 ModelScope:同一個服務的 ModelScope 版目前狀態是運行中,頁面顯示超過 12 萬次瀏覽,介面就是上傳音檔、選任務、聽結果,連帳號都不用註冊就能試。其實 README 在 2025 年 1 月的新聞欄就寫過「HuggingFace 的 GPU 額度有限,ModelScope 額度比較多」,現在的狀況只是這句話的極限版。

ModelScope 上 ClearerVoice-Studio 語音處理平台的演示頁面,顯示运行中狀態與音檔上傳介面Pin
ModelScope 版演示(2026-10):狀態運行中、逾 12 萬次瀏覽,是官方目前唯一活著的線上試用入口。

想找其他瀏覽器裡的方案,之前介紹過的 Chrome 人聲分離擴充功能 走的是本機運算路線,適合即時處理會議或通話聲;ClearerVoice 的強項則在批量檔案與可程式化,兩者其實互補。

維護狀態是真正要看的紅線

判斷一套開源工具能不能長期依賴,星星數向來不作準,要緊的是有沒有人持續打掃。這裡的答案偏向沒有:主分支最後一次提交停在 2025 年 8 月 14 日,內容是更新 README;PyPI 上的 clearvoice 套件 0.1.2 版發布於 2025 年 7 月 11 日,之後再沒有新版本。README 頂端的 News 欄最後一條是 2025 年 6 月,還掛著「Upcoming: More tasks」的預告,至今沒有下文。

issue 追蹤區累積了 83 個未解項目,2026 年的新通報基本都沒有得到官方答覆。比較具體的例子:有人在今年 7 月仔細列出 MossFormer2_SE_48K 在 NumPy 介面處理超過 20 秒音檔時的三個程式錯誤,附上完整修補 diff,至今無人處理;我把 PyPI 出廠包解開對照,那三個出問題的程式碼位置在 0.1.2 版裡一字不差地都在。pull request 區同樣堆了 9 個等待合併的提交,最舊的一個(幫 FRCRN 加即時處理)從 2024 年 12 月排隊到現在;還有一個把相依套件放寬到 NumPy 2 相容的提交也躺滿三個月,這直接影響一般使用者:套件的版本約束目前釘著 numpy<2.0,在已經全面升上 NumPy 2 的環境裝它,得另外隔離一個環境。修好的程式碼就在門口,只是沒有人開門。

對使用者的實際意義:裝起來用的瞬間,你接受的是 2025 年 8 月的快照,問題只能靠 issue 區彼此幫忙或自己 fork。好處是快照本身能用、權重下載正常、模型在大規模場景被驗證過;壞處是下一個 Python 大版本、下一個相依套件的破壞性更新,都得自己扛。兩位主力作者的電子信箱就掛在 README 上,但從 issue 區的靜默看,別把答覆寄望在官方身上。

接進自己程式前的幾個坑

取樣率是自己扛的責任。 NumPy 陣列輸入的介面不會檢查你的音檔取樣率,官方範例的註解寫明 48kHz 模型就要先自己把陣列重取樣到 48000Hz 再餵進去。我實際對照過:把 16kHz 的陣列直接餵給 48kHz 模型,不會報錯,程式照樣跑完,只是它把 25.6 秒的聲音當成 8.5 秒的 48kHz 訊號在處理,時間軸整個錯掉。檔案路徑模式沒有這個問題,它會自己處理取樣率。

長音檔別走 NumPy 介面。 上面提到的那組三個錯誤,後果是超過 20 秒的陣列輸入會走進一段有問題的分段處理分支,通報者量到的現象包括 60 秒的輸入被墊成 66 秒的輸出,以及 192 秒的音檔在修復前直接讓 Python 行程被系統終結、連錯誤訊息都沒有。同一批錯誤不影響檔案路徑模式,所以我全部的實測都以檔案或正確重取樣的路徑為準。

Windows 使用者直接走 PyPI。 從 GitHub 下載 repo 再照 requirements.txt 安裝的路線,在 Windows 會卡在 pesq、pysptk 兩個需要微軟 C 編譯器的套件上,今年 2 月就有人反映,至今掛著。PyPI 的 clearvoice 套件 dependencies 沒有這兩項,安裝路線選對就沒事。

評分時記得官方但書。 README 自己記了一筆:用 48kHz 模型處理後,LLR 與 LSD 兩個指標出現異常,原因還在查。你要用 SpeechScore 替輸出打分數,這兩項先打個問號。

視訊與腦電任務沒有實測。 目標說話人提取的視聽融合模型需要影片檔當輸入(官方支援 AVI、MP4、MOV、WebM),訓練目錄裡的腦電子任務更屬於實驗室性質。這篇的實測範圍是純音檔的增強與分離,這兩塊我沒有跑,需要的人直接看 repo 對應子目錄的說明文件會比任何轉述可靠。

誰該裝,誰該繞開

適合的情境很明確:手上有訪談、Podcast 素材或配音稿要清理,想用不用錢的方案在本機批次處理,不想把檔案傳到雲端服務;或者你在做語音相關的實驗,需要一組現成的預訓練模型當基準。清理完的錄音如果要變成文字稿,可以接著交給 本機就能跑的語音轉文字工具,或交給 線上的錄音轉文字服務;方向相反、要把乾淨文字唸成聲音的,之前寫過的 開源文字轉語音模型 與 自架的微軟語音服務 都在站上。

不適合的情境同樣明確:你需要的是圖形介面按到底(用 ModelScope 線上版就好)、你需要商業支援與維護承諾、或者你的產品要把它的長音檔 NumPy 路徑放進關鍵流程(那組已知的錯誤還躺著)。還有一種人要三思:環境已經全面升上 NumPy 2 的團隊,得多養一個隔離環境來伺候它的版本約束。

第一步很單純:pip install clearvoice,拿一段你自己的錄音跑上面那三行程式,聽完輸出再決定要不要把它留下來。它是那種「前人種好樹、後人自澆水」的工具,樹是真的能乘涼,澆水這件事,現在得自己來。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1672

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...