悟空AI音效:打字就能生成影片音效,底層是開源 MMAudio 模型

悟空AI音效把 UIUC 與 Sony 的開源模型 MMAudio 包成中文積分制服務:登入後 5 次免費,之後每次 20 到 30 點積分,永久會員 98 元人民幣。台灣讀者先過連線與中國手機號兩道牆,想先聽效果可從 MMAudio 官方免費示範頁開始。

用 AI 摘要這篇文章:

悟空AI音效(wukong.ttson.cn)是一個簡體中文介面的 AI 音效生成網站:輸入一段文字描述或一段影片,它生成可以搭配創作的音效,站方把它定位在影片配音、遊戲音效、動畫製作這些場景。先把結論講完:這個站實際跑的模型,是伊利諾大學香檳分校與 Sony 研究團隊公開的開源專案 MMAudio,論文發表在 CVPR 2025、程式碼採 MIT 授權,模型權重則以禁止商業使用的條款釋出;悟空AI音效做的部分,主要是把模型包上中文介面,再套一層積分制收款。免費額度是登入後 5 次,之後站方字串寫的計價是文字生成每次 20 點積分、其他生成方式每次 30 點,永久會員一次收 98 元人民幣。對台灣讀者來說,還有兩道排在價格前面的牆:這個站直連多半連不上,而註冊的主要表單要 11 碼的中國手機號。

先說結論:免費嘗試只有五次,模型本尊另有免費管道

把整體判斷濃縮起來,就是三件事。

身分要先講清楚。悟空AI音效不是詐騙站,也沒有宣稱自己研發了模型;它的站點描述直接寫明「依託 MMAudio 多模態技術」。MMAudio 的程式碼以 MIT 授權公開,模型權重卻是另一回事:官方以禁止商業使用的 CC-BY-NC 4.0 條款釋出權重,README 還明言不保證模型適合商業用途。把這樣的權重包成收費服務是否牴觸非商業條款,站方沒有交代;98 元的定價倒是公開寫在自己的會員頁上,沒有藏費用。合法性是一個還沒有答案的疑問,值不值得付的問題排在它後面。

「免費」的份量則輕得多。登入後 5 次是全部的免費額度,用完就走積分制,而積分的增加管道,前端程式碼裡有兩組互相矛盾的寫法:免費用戶特權列的是分享一次加 1 點、邀請註冊加 5 點,積分說明卻寫分享作品得 10 點、邀請好友註冊得 20 點。同一個動作兩組數字,實際結算看哪一邊,不註冊無法確認。對只想試水溫的人,5 次很快會用完;對不想拉人也不想分享的人,這樣的免費額度形同沒有。

至於替代品,MMAudio 的官方 GitHub 文件列出三條免費試用管道:HuggingFace 示範頁、Colab 筆記本,以及一個 Replicate 版本。同一個模型、同樣的輸入輸出,不花一毛錢就能聽到效果。所以真正值得想的問題從來不是「悟空AI音效好不好用」,而是「中文化介面加提示詞優化,對你個人值 98 元人民幣嗎」。

計費規則全寫在前端程式碼裡,不用註冊也看得一清二楚

有意思的地方在於,這個站的商業規則完全不需要註冊就能看清。我把它打包後的 JavaScript 檔案抓下來直接讀,計費相關的字串一應俱全:免費用戶特權寫的是「登入後5次使用」「分享一次 +1」「邀請註冊 +5」;積分說明寫「文字生成:20積分/次,其他生成:30積分/次」「分享作品獲得10積分獎勵」;會員方案則是一個「成為會員」視窗,價格「98元」搭配「永久會員」,特權列了「永久無限使用」「專屬客服支援」「優先更新功能」三項。

從同一份程式碼還讀得到兩個更關鍵的端點。收款走的是 pay.ttson.cn 的 10010 連接埠,一個自建的支付服務;生成請求走的後端,掛在 seetacloud.com 的網域底下,這是 AutoDL 算力平台的容器位址。換句話說,它的推論算力是向 GPU 雲租的,收款系統是自己的,模型是開源的,三件事拼起來,這比較像一個人或少數人就能撐起來的輕量服務,而非養了模型團隊的產品公司。這是我從程式碼端點做的推論,站方自己沒有公開說明營運規模。

有一個付費前該問的問題,程式碼裡找不到答案:98 元的永久會員與積分制之間的換算。前端寫清楚了每次生成扣多少積分,也寫清楚了會員價格,但「永久無限使用」與「積分每次扣」兩種計費並存,實際走向哪一邊、儲值一個金額能換多少積分,這些字串裡都沒有出現。這種資訊落差對照它的母站生態並不意外:ttson.cn 主站做的是文字轉語音,存檔頁面自述完全免費,實際計費結構無法從這份存檔確認。付錢之前,至少先在站上找到現行的積分說明頁,確認你買到的額度怎麼算,因為這些數字隨時可能調整,而我讀到的只是前端程式碼裡的靜態字串。

站上倒是有幾個包裝層功能值得記下:介面路由分成生成、分享音效庫、個人頁三區,程式碼裡還有示範案例庫與音效分類的資料端點,等於站方預先整理了一批範例讓新使用者參考。分享音效庫的設計對應前面的積分規則:把作品丟上去一次加 1 點,既是社群功能,也是讓免費額度「看起來有救」的留客設計。

註冊的第一道門是 11 碼中國手機號

註冊表單的驗證字串同樣寫在前端程式碼裡:手機號欄位要求「請輸入11位手機號」,配套的是簡訊驗證碼登入。台灣的手機號是 09 開頭共 10 碼,過不了這條檢查,按鈕畫面上另有 GitHub、Google、微信三條第三方登入的路,但我讀到的存檔版本程式碼裡,三個登入函式都先檢查建置參數,參數是空值就直接跳「功能暫未配置」的提示(字串裡寫了首次第三方登入會自動建立帳號,但功能本體在這份建置裡沒有接上)。也就是說,在這份 2026 年 4 月的程式碼裡,第三方登入沒有一條真正接上,中國手機號是唯一實際可用的註冊路;現在接好了沒,站點連不上,無法確認。

順著網域往上摸,wukong 是 ttson.cn 的子網域,主站名為「海豚Ai」,做的是多語言文字轉語音工具,主打 160 種以上配音與有聲書合成。整個網域底下看不到公司名稱,頁面與程式碼裡都找不到 ICP 備案號,對外聯絡管道是微信群。這些訊號放在一起看,它就是一個以簡體中文使用者為對象的個人系工具站,沒有對外揭露的營運主體。

模型本尊另有出處:UIUC 與 Sony 的公開論文 MMAudio

被包裝的模型本尊,來頭不小。MMAudio 由伊利諾大學香檳分校的 Ho Kei Cheng,與 Sony AI、Sony Group 的研究者共同開發,論文標題為「Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis」,2025 年發表在電腦視覺領域的頂級會議 CVPR。專案在 GitHub 上累積 2,267 個星標與 268 次 fork,程式碼採 MIT 授權,模型權重以 CC-BY-NC 4.0 非商業條款另外釋出。

用一句話講它的能力:給它一段影片或一段文字描述,它生成與畫面同步的音訊,做法上靠多模態聯合訓練,同時吃進影音配對資料與帶文字描述的音訊資料,再用一個同步模組讓聲音對得上畫面的時間軸。多數同類模型只吃得到影音配對資料,量少而且場景偏窄;MMAudio 把大量帶文字描述的音訊資料也一起拿來訓練,這是論文的主要貢獻,也是它生成的音效在素材多樣性上站得住腳的原因。

MMAudio 官方 GitHub 專案頁,顯示 CVPR 2025 論文標題、2,267 個星標與 MIT 授權Pin
MMAudio 官方 GitHub 專案頁(hkchengrex/MMAudio),論文發表於 CVPR 2025,MIT 授權開源

官方的免費示範頁就架在 HuggingFace 上,用 Gradio 介面,累積了近千個讚。介面分成影片轉音效與文字轉音效兩個分頁,欄位有輸入區、提示詞、反面提示詞、亂數種子與幾個取樣參數,輸出面板放在另一側,對第一次接觸的人也算好懂。

MMAudio 官方 HuggingFace 示範頁介面,左側為影片上傳區與提示詞欄位Pin
MMAudio 官方 HuggingFace 示範頁,免費可用,左側是影片上傳、提示詞與反面提示詞欄位

對實際使用更有價值的,是官方 README 與示範頁明寫的工程邊界,條列如下。

  • 模型以 8 秒長度訓練,示範頁的建議輸入是 5 到 12 秒,偏離太多品質會下降。所以別期待一次生成一分鐘的環境音,長片段要自己分段再接。
  • 圖片轉音效屬於實驗性功能,原理是把同一張圖複製成一串連續畫面,再交給影片管線處理,官方明言這不是模型訓練過的任務。
  • 輸出的音訊檔是 flac 無損格式;示範頁的影片分頁還預設在反面提示詞欄填上 music,用來壓掉不想出現的音樂成分。

這些邊界不會因為換了一層包裝就消失。悟空AI音效跑的是同一個模型,8 秒的訓練時長、圖片輸入的實驗性質,照樣適用。

和官方免費管道比,98 元買的是中文化與順手

拿悟空AI音效與官方免費管道並排放,差異集中在費用、語言與帳號三件事上。

悟空AI音效MMAudio HuggingFace 示範頁MMAudio Colab 筆記本
費用登入後 5 次免費,之後積分制,永久會員 98 元人民幣免費免費
介面語言簡體中文英文英文
輸入類型文字、影片等(存檔僅見「其他生成」計價字串)文字、影片文字、影片
帳號需求中國手機號(第三方登入在存檔版本未配置)HuggingFace 帳號Google 帳號
加值服務提示詞優化、分享音效庫、積分任務無無
主要限制額度與積分經濟GPU 排隊與時段限用需要一點執行環境概念

從它前端的介面路徑看,包裝層自加的功能確實不少:生成端點之外,還有提示詞優化、示範案例庫、音效分類、作品分享幾個服務。提示詞優化對不擅長寫英文音效描述的人有實質幫助,分享音效庫則讓站上有社群沉澱的空間,這些是 98 元真正買到的東西;如果你本來就能寫英文提示詞、也不在意排隊,官方示範頁的免費額度夠你把模型摸熟。

付費結構還有一層值得想:98 元是「一次買斷永久用」,而 GitHub 文件列的 Replicate 版本走的是按次計費的 API 模式,用多少付多少,不用預先掏一筆錢。對一個月只生成十幾次的人,按次計費通常比買斷便宜;但買斷的誘惑在於心裡踏實,這也是這類包裝站常見的定價心理。真正的風險是永久會員綁在單一網站上,站點規模小、營運主體不透明,一旦站收掉,永久兩個字就跟著失效,這筆帳在付款前值得算一下。

台灣讀者的兩道牆:連線與手機註冊

我在 2026 年 9 月下旬從台灣的網路環境直連 wukong.ttson.cn 測了兩次,兩次都在 12 秒後連線逾時,對主機的 ping 也完全沒有回應。這個結果不能推論站已經關閉:網際網路檔案館在 2026 年 4 月 8 日存有這個站的完整頁面,計費文案與今天讀到的程式碼一致,合理的解釋是它對境外連線路徑不穩,或對非中國大陸流量做了限制,實際能不能連上,以你連線當下的情況為準。

把連線問題和 11 碼手機號的註冊門檻疊在一起,你的現實處境是:就算連上了,註冊主路卡在中國手機號,存檔版本裡第三方登入也沒有一條接上;連不上,則連頁面都看不到。兩道牆都在付費討論之前,這也是我把官方免費管道列為首選的原因。

想生成音效的人,下一步怎麼走

依情境分流最省時間。

只想先聽聽 AI 音效生成的水準:直接開 MMAudio 的 HuggingFace 示範頁,免費、免安裝,把 thunderstorm with heavy rain 這類英文描述貼進提示欄就有結果,聽完再決定要不要為介面付費。寫提示詞有個實用原則可以從示範頁的欄位設計反推:先寫現象、再寫材質與環境。與其丟一個「熱鬧的街道」,不如拆成 street traffic with car horns and footsteps on wet pavement,讓模型知道要出現哪些聲音層;示範頁的影片分頁會預設在反面提示詞欄填上 music 來壓掉亂入的背景音樂;切到純文字分頁時這個欄位預設是空的,記得自己補上。

簡體中文環境順手、需要批量生成、不介意一次付 98 元人民幣:悟空AI音效的中文介面與提示詞優化確實省事,但先確認你連得上、登得了,再談付費。

需求是完整音樂或語音處理:音效、音樂、語音是三條不同的工具線。要整首歌可以看 DiffRhythm 全長歌曲生成的實測;用 AI 產出影片後要補畫質,可以搭 Video2X 開源放大工具;演講或訪談要逐字稿,Parakeet 語音轉文字模型 是本地跑得動的選擇;若是想找現成音效而不是自己生成,小森平的免費音效素材庫提供了不用碰 AI 模型的另一條路。先挑對線,再挑工具,比在一個積分制包裝站裡糾結額度來得省事。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1566

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...