有道 Clear 人聲分離擴充實測:先看清官網 ZIP 現在能不能用

網易有道 MOOHO 團隊的 Clear 擴充主打瀏覽器內即時人聲分離、100% 本機 CPU 運算。實測官網現發的 ZIP 發現設定面板會被自家失效的更新檢查端點自動關閉,安裝包內也沒有分離模型;這家技術現在實際能用的入口在行動裝置版。

用 AI 摘要這篇文章:

2026 年 9 月把官網發的 Clear 安裝包載入瀏覽器實測,實際會遇到的事是這樣:點工具列圖示,設定面板只會閃一下就消失,任何模式都按不到。這款由網易有道 MOOHO Sound Lab 團隊做的瀏覽器擴充,官網標榜即時人聲分離、100% 在你電腦 CPU 上運算的 AI、零延遲,規格方向相當前衛;但把官網正在發的安裝包實際載入瀏覽器測試後,查到兩個會直接改變你判斷的事實:安裝包的更新檢查機制會把設定面板自己關掉,而且包裡根本沒有放進做人聲分離用的模型。兩個關鍵事實,加上現在真正能用的入口,下面一次講清楚。

從下載到面板自關,中間發生了什麼

clear.youdao.com 首頁的 Download for free 按鈕,連到一個 32.7MB 的 ZIP 檔,檔名標著 v2.0.0。它沒有上 Chrome 線上應用程式商店,商店內搜尋 Clear 或 Realtime Audio Filter 都查不到這個擴充的列版,想用只能解壓縮後打開 Chrome 的開發人員模式,以載入未封裝項目的方式手動安裝。這個安裝形態本身就有代價:沒有商店審核、沒有自動更新,權限全靠你自己看著辦。

Clear 官網首頁,Download for free 按鈕與即時音訊分離賣點Pin
Clear 官網首頁:所有下載按鈕都指向同一個 ZIP 檔,未上 Chrome 商店。

把未修改的安裝包載入 Chromium 實測,設定面板其實有完整的介面:分離模式有 2-Stems、5-Stems、Denoise、Dereverb、Denoise and Dereverb 五種,品質檔有 Fast 與 HQ,人聲與伴奏各有一支即時音量滑桿,預設把人聲拉到 0、伴奏留滿,也就是拿來做卡拉OK伴唱的設定。五軌模式再細分人聲、鼓、貝斯、鋼琴與其他樂器,降噪與去殘響則是反過來保留人聲、把雜音壓掉,四種情境對應不同模型。面板開起來不到一秒,整個視窗就自己關閉。

Clear 擴充設定面板介面,含 2-Stems 五種分離模式與人聲伴奏滑桿Pin
Clear 擴充的設定面板:五種分離模式、Fast 與 HQ 品質檔、人聲與伴奏滑桿。

原因寫在程式碼裡。設定面板每次開啟,都會先連到一個阿里雲 OSS 海外加速端點要求 version.json 版本檔,拿得到就把遠端版本號跟本機比對:版本相同就正常進入,版本不同則彈出更新提示,並把模式選單與滑桿整排隱藏,只留一顆更新按鈕,等於強制你先換成新版本才能繼續用。拿不到版本檔呢,錯誤處理分支只有一行,直接呼叫關閉視窗。這個版本檔現在伺服器回應的是不存在,間隔超過十分鐘的兩次測試都拿到同樣結果,瀏覽器主控台也留下請求失敗的紀錄。換句話說,從工具列點開面板的正常使用情境,會走同一條檢查然後立刻自關。開發者把更新檢查設計成使用前的必要關卡,端點一失效,整個擴充就從入口處鎖死,而那個端點的路徑是一串不透明的長字串,放在阿里雲的一個公開儲存桶裡,現在已經失效,外部也沒有任何資訊說明原因。

打開安裝包,滿手權限與一套沒有模型的引擎

解開 ZIP 總共 42 個檔案。manifest 聲明的權限有 tabCapture、tabs、activeTab、storage,主機權限則是所有網站。tabCapture 是這類即時音訊工具的核心:擴充能擷取你目前正在播放的分頁聲音,交給內部引擎處理後再播回來;tabs 讓它在背景知道每個分頁的狀態,storage 記住你的模式與滑桿設定。搭配所有網站的主機權限,它能作用於任何網站上的音訊,YouTube、Spotify 網頁版或任何播放器都算。它拿不到的是分頁的畫面內容與你在其他視窗的操作,音訊擷取的範圍以那個分頁為限,這也是判斷這類工具權限風險時比較能放心的一條邊界。

程式邏輯也看得出架構。照包內程式的設計,啟動分離時擴充會另外開一個背景處理頁,即時分離在裡面跑,頁面上寫著把這頁關掉分離就會停止;處理完的聲音從那個脈絡播回你的喇叭或耳機。也就是說,使用期間會多一個常駐的分頁,這是它對準零延遲監聽的做法,也是實際使用時的小麻煩。

引擎部分放的是 ONNX Runtime Web 的 WASM 執行環境,模型資料夾裡有一個 5.3MB 的 model.onnx。照官網說法,AI 全部在你電腦的 CPU 上跑,聲音不需要上雲端;從安裝包的組成看,這個方向是真的,處理鏈是瀏覽器 AudioWorklet 搭配 WASM 推理,取樣率設定 48kHz、每 480 取樣點一個區塊的串流節奏,音檔確實不出門。麻煩出在模型本身,這是整個安裝包裡最反常的地方。

包內唯一的 AI 模型,長得像圖片分類器

把 model.onnx 解析開看:輸入維度是 1 乘 3 乘 224 乘 224,也就是一張三通道的 224×224 影像;輸出是 1,000 維的分數向量;內部 154 個運算節點裡有 63 個卷積層,由 PyTorch 2.1.0 匯出,沒有留下任何名稱或來源標記。用包內附的執行環境在瀏覽器實際跑一次推論,40 毫秒就吐出 1,000 個分數。這是 ImageNet 式圖片分類器的外形,吃圖片、吐類別分數;人聲分離模型需要的是吃音訊區塊、吐等長的音訊區塊,輸入輸出的形狀完全對不上,用 1,000 個分數也還原不出任何一段聲音。程式碼裡負責呼叫模型的處理器,指向的正是這個檔案,也就是說高品質雙軌模式接上的是一顆做不了分離的模型。

另一條引擎路線也一樣空。manifest 的資源清單列了 data1、data2 兩個檔案,程式碼的載入邏輯也會去包內找它們,其餘模式都排在這條路線上,但 ZIP 裡就是沒有這兩個檔。五種分離模式對應的模型,一個都不在安裝包裡。是打包時漏放,還是開發階段的佔位模型直接出了貨,從包外無法證實;能確定的是,就算繞過前面那個自關問題,這份 ZIP 也沒有東西能做分離。一個 32.7MB 的安裝包,扣掉執行環境與介面圖檔,留給模型的位置其實擺不下一套完整的五模式模型組,這也暗示模型本來可能就不打包在安裝包裡,而現在包內包外都找不到取得模型的地方。

本機運算是真的,零連線是另一回事

「100% CPU-Powered AI」是官網的五個賣點之一,另外四個是即時音訊增強、即時多軌分離、零延遲零負擔、精準度。聲音處理在本機這件事,前面看過的套件組成可以支撐;但本機運算不等於零連線。安裝包裡的紀錄模組寫得很明白:每次啟動分離,它會先連一個查詢對外 IP 的服務取得你的 IP 位址,再連同存在瀏覽器 localStorage 裡的裝置編號,一起送到有道的紀錄端點,產品代號標著 speech realtime audio web,事件代號 on。裝置編號的產生規則是時間戳加亂數,存在本機不會刪,下次啟動沿用同一個。送出去的就是 IP 加一串編號,沒有音訊內容;但如果你在意免費本機工具回報哪些資料,這條邊界應該要知道。整包程式對外的連線位址就四個:紀錄端點、IP 查詢、版本檢查,以及品質選項裡那個 Hi-Res 按鈕連去的 vox.youdao.com。

隱私政策本身的適用範圍也值得對照著看。這份 2025 年 3 月 31 日版的政策,主體是北京網易有道,涵蓋的是 Clear 這個品牌的網站、App 與軟體整個家族,裡面寫會蒐集你上傳的音檔內容與關聯中繼資料,列出的服務商包括阿里雲、Firebase、Google 等。就擴充本身而言,程式碼裡看不到音檔外送的路徑,行為與政策的差距反映了兩件事:政策是為會把音檔送上雲端的家族成員寫的,而擴充實際回報的只有前述那組遙測資料。讀的時候把「政策寫了什麼」與「程式做了什麼」分開看,會比單看任何一邊準確。

授權也值得先看。服務條款寫明這個擴充僅供個人非商業用途使用,處理的音檔要自行確認有權處理,侵權責任在使用者身上;你想拿它處理商業案的音檔,條款上是不行的。

這家技術現在實際活在哪裡

順著安裝包裡的連結往外追,會看到這個產品家族的重心已經整個移走。vox.youdao.com 現在是一個 iOS App 的產品介紹頁,頁面上留的聯絡信箱是 Gmail,介紹的 Clear Audio Filter App 在 App Store 上的開發者是 TALENT ME TECHNOLOGY PTE. LTD.,版本 1.3.0,最後更新 2025 年 7 月,標榜即時分離與無損模式,無損模式最多拆七軌、48kHz 取樣,支援音訊與影片匯入匯出,對象寫的是歌手、製作人、樂手與內容創作者。App Store 頁面上沒有提到有道或網易,兩邊的關聯只留在 vox 這個有道網域的產品頁,以及貫穿官網、舊商店入口與行動版的同一條 Clear 品牌線。

擴充本體的維護跡象也一致。安裝包內檔案的時間戳停在 2025 年 4 月,隱私政策停在同年 3 月,商店上則有一個 2025 年 1 月就停更的舊入口 That’s it Vocal Remover,758 個使用者、3.4 星,說明欄直接叫使用者去 vox.youdao.com。擴充處理頁的標題連結連去 magic.youdao.com,這個網域現在整個轉址回 clear.youdao.com 本站,是同一個產品用過的另一個名字。擴充處理頁與商店舊入口都連往同一個 YouTube 頻道,那個頻道現在已是 404 頁,官網頁尾剩下的對外帳號是一個 TikTok 與一個小紅書個人頁。把這些放在一起看,比較合理的讀法是:這個擴充在 2025 年上半完成開發與推廣後就靜止了,團隊把力氣移到行動裝置版本,桌面瀏覽器這條線留著官網與下載檔,但沒有留下能用的東西。

限制與未知,一次說清楚

這些觀察的對象是 2026 年 9 月 14 日從官網下載的這一份 ZIP,版本檔失效做了兩次間隔複測;如果官方哪天把版本檔放回去,面板自關會消失,但模型缺席的問題仍然在,兩者是獨立的。2025 年發布當時這個擴充是否完整可用,無法從現在下載的東西回推,當年的介紹文章描述過它正常運作的樣子,那是它那個時空的事。iOS 版 App 的分離品質、速度與付費結構,要自己下載才知道;App Store 上 4.6 星只有 5 則評分,樣本很小。維護停擺的說法是從檔案時間、失效端點、消失的頻道這些跡象推得的判斷,官方沒有任何公告。面板自關這件事,是在未修改的安裝包上確認錯誤分支會呼叫關閉視窗;真實工具列點開的情境載入同一份程式碼、走同一條檢查路徑。

如果你今天就要在電腦上做分離或伴唱,站內先前介紹過的工具可以直接接手:voicss 是網頁上傳即分離的人聲伴奏拆分工具,免費帳號有一次完整額度,處理在雲端完成;audiomass 則是瀏覽器裡的音訊編輯器,需要手動修整音軌時用得上。想把手邊影片或錄音先轉成文字再處理,可以看 any2text 的介紹。

所以要不要裝

我的判斷很直接:不要花時間側載這份 ZIP。它需要你打開開發人員模式、手動載入一個未經商店審核的套件,換到的卻是一個開了就自關、包內沒有模型的面板;就算你願意等,等到的也不會是修 bug,而是整條產品線的復活,跡象上期望應該放低。你的需求若是練唱跟伴奏,重點在有立即可用的人聲移除,這份 ZIP 給不了;若是想把分離結果匯出成檔案再後製,行動版的匯出功能與桌機替代工具都更實際。使用 iPhone 或 iPad 的讀者,App Store 上的 Clear Audio Filter App 是這家技術現在實際存在的形態,值得自己下載驗證看看:匯入一首歌試即時模式的反應,再看無損模式拆出來的軌道準不準;下載免費,成本是你的時間。桌面讀者的現實選擇就是上面的替代工具。

日後想回頭確認官方是否修復,看的指標有兩個:官網下載的 ZIP 版本號有沒有從 2.0.0 前進,以及 Chrome 商店有沒有出現正式上架的頁面。這兩個都沒動,結論就維持原樣。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1314

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...