Fish Audio 語音克隆:開源能下載,商用權在訂閱裡

Fish Audio 以開源 TTS 模型 fish-speech 走紅,32,953 顆星的 repo 掛的卻是研究授權:商用要另外簽約,自架需要 24GB 顯示卡記憶體。免費雲端每月 8,000 積分約生成七分鐘且僅限個人非商業,商用權從每月 15 美元的 Plus 方案開始。行銷頁示範名人聲音克隆的玩法,條款則把法律責任留給使用者。

用 AI 摘要這篇文章:

打開 Fish Audio 的 GitHub 頁面,第一眼看到的是 32,953 顆星和一句「SOTA Open Source TTS」(最先進的開源文字轉語音)。打開它官網的語音克隆頁,看到的是「15 秒克隆任何聲音」「10 秒樣本就夠」。這兩句話都沒有說謊,但合起來讀會讓人誤以為:下載一套免費開源模型,就能做出一個可以接案、可以上架的語音產品。實際的結構剛好把這條路堵住:開源版掛的是研究授權,商用要另外簽約,真正能商用的入口是月費 15 美元起跳的雲端訂閱。

Fish Audio 的三條使用路徑(免費雲端、付費訂閱、下載開源模型自架)邊界各不相同:錢花在哪裡、法律責任落在誰身上,以及哪些數字只是行銷口徑。如果你正在找語音克隆工具,這些條件會直接決定你該從哪一條路開始。

32,953 顆星的 repo,授權第一頁就寫著商用要另外談

fishaudio/fish-speech 是這家公司所有公開程式碼的主體,從 2023 年底一路迭代到現在,最近一次提交在 2026 年 9 月中。2026 年 3 月 9 日他們發佈了 S2 並開源,釋出內容包含三樣東西:S2 Pro 模型權重(40 億參數,放在 HuggingFace 上,累積下載約 3.3 萬次)、微調用的程式碼,以及一套以 SGLang 為基礎的串流推理引擎。以開源 TTS 專案來說,這個完整度是少見的:權重、訓練配套、推論部署一次給齊。

但這個 repo 的 LICENSE 檔走的是另一條路:一份〈FISH AUDIO RESEARCH LICENSE AGREEMENT〉,最後更新日期 2026 年 3 月 7 日。條文把用途分成兩類:研究用途(學術與科學目的)與非商業用途(個人嗜好、評估測試)可以免費使用、修改、散佈;至於商用,原文寫得很直白:任何商業目的的使用都需要向 Fish Audio 另外取得書面授權,想談商用就寄信到 [email protected]。條文對「商業目的」的定義也抓得很寬:用它提供託管服務或 API 算、公司內部營運算、任何「直接或間接產生收益」的用途都算。

換句話說,看到「開源免費」就打算自架接案的讀者,會在授權第一頁碰壁。這不是技術問題,是這家公司選擇的商業結構:模型權重公開給研究界檢驗與推廣,收入的門則開在雲端訂閱那一側。README 裡還有一行「We will take action against any violation of the license」(我們會對任何違反授權的行為採取行動),態度是明確的。

就算你的用途真的是研究或個人練習,自架還有一道硬體門檻。官方安裝文件寫的推理需求是 24GB 的 GPU 記憶體,系統環境是 Linux 或 WSL,安裝文件提供 Conda、UV 與 Docker 等多種部署選項。這個數字等於一張 RTX 4090 等級的顯卡。對多數創作者來說,「免費開源」的實際意思是:免費的權重,加上一台你未必有的機器,加上一段 Docker 與指令列的折騰(想比較輕量的開源自架 TTS 選擇,可以參考LibreTTS 的自架經驗)。

GitHub 上 fishaudio/fish-speech 儲存庫頁面,顯示 33k 星數與授權標示Pin
fishaudio/fish-speech 儲存庫首頁:32,953 顆星,LICENSE 檔掛的是 FISH AUDIO RESEARCH LICENSE。

模型本身的賣點也值得認識一下。S2 世代最大的特色是把情緒控制寫進文字裡:在文字中插入方括號標記,例如(笑)、(壓低聲音)、(興奮),就能指定某個詞的情緒與語調;標記可以直接寫 [laughing]、[whisper] 這類原文,也接受自由文字描述,官方標示支援超過 15,000 種標記。它也能在一次生成裡輸出多個說話者的對話,以及利用上下文讓連續對話越講越自然。這些能力在開源 TTS 裡屬於少見的設計,也是它敢自稱 SOTA 的本錢。周邊生態同樣完整:官方維護 Python、TypeScript、Go 語言的 SDK 與 n8n 整合,前身專案 Bert-VITS2(8,803 顆星)也在同一個組織下,看得出這是一家以開源起家、再把商業收在雲端的團隊。

免費雲端帳戶每個月只夠生成約七分鐘語音,而且條款寫明不能商用

不碰程式碼、直接用網頁版的讀者,面對的是另一套規則。定價頁上的免費方案寫得很清楚:每月 8,000 積分、站方標註「最多生成 7 分鐘」、單次輸入上限 500 字、3 個公開音色槽位,註冊不需要綁信用卡。這個額度拿來試聽音色、熟悉操作,順便判斷中文生成品質夠不夠用,是足夠的;拿來做一集十分鐘的影片旁白,就不夠了(只想做基本配音、不需要克隆的讀者,微軟 Edge 語音的免費工具額度更寬鬆)。

想先感受克隆效果,語音克隆頁本身內建了一個示範區:頁面提供一段示範文字讓訪客試讀,標榜由線上版的 S2.1 Pro 模型驅動。這也是評估這類服務最省事的第一步,連帳號都不用建就能先聽到模型的底子。

Fish Audio 語音克隆頁首屏,15 秒克隆標語與示範區Pin
語音克隆頁首屏:標榜 10 秒樣本、免費層無需綁卡,示範區由 S2.1 Pro 驅動。

用途的限制比額度更關鍵。服務條款的「Permissions and Restrictions」一節明訂:你只能將服務用於個人的非商業用途,除非你是付費方案的用戶,才獲授權進行商業使用。定價頁 FAQ 的問答也重複了同一件事:免費用戶僅限個人非商業使用。有趣的是,定價頁方案卡片的排版把「商業使用」四個字排得很靠近免費欄位的尾端,第一次看很容易誤讀成免費版也包含商用;條款和 FAQ 兩處的正式文字都指向相反結論,判斷時以條款為準。

積分制本身也有一個站方沒解釋的落差。定價頁 FAQ 說每分鐘生成大約消耗 600 到 625 點積分,照這個換算,8,000 點應該能生成約 12 到 13 分鐘;但免費卡片上寫的是「最多生成 7 分鐘」。兩個數字出自同一個頁面,換算卻對不上。可能的解釋是不同功能(例如克隆音色的生成、不同模型等級)消耗的積分係數不同,但站方沒有公布明細。實務上的教訓是:免費額度實際能生成多久,要在介面裡自己消耗一次才知道,行銷頁上的分鐘數只能當下限參考。

行銷頁要你拿總統的聲音玩,條款頁要你自己扛全部責任

Fish Audio 的語音克隆行銷文案很敢寫。語音克隆頁的開場範例是:「讓一位現任總統為你的交友軟體配旁白,讓科技億萬富翁發佈你最離譜的創業點子,或者做一檔全員虛構的播客座談」。往下捲動,還能看到「模仿秀短片」「24 小時吐槽頻道」「同一個梗換四種語言出海」這些玩法示範。以行銷而論它很有效,名人聲音確實是最抓眼球的展示品。

但同一頁的 FAQ 換了一個口徑:克隆任何聲音前,「你有責任確認自己已獲得所需的權利、同意和揭露,並遵守所在地區關於姓名、肖像與 AI 生成內容的適用法律」,而 Fish Audio「不會預先審批具體用例」。服務條款再補一層:不得以冒用他人名義的方式使用服務,你並且同意就任何相關求償替平台免責並承擔對方的法律費用。兩句話合起來的意思是:示範影片教你玩名人聲音,責任則百分之百在使用者身上。

回到克隆本身的技術門檻,官方說法是:10 秒乾淨語音就足夠,更長的樣本對表現力豐富的聲音有幫助,大多數公眾人物片段、播客切片甚至電話音質的錄音第一次就能用;克隆會保留原聲的情緒傾向,憤怒、諷刺、遲疑這些細節會延續到生成的每一句話。換一個語言輸出也做得到,站方標示 13 種語言零樣本跨語種,意思是用英文樣本克隆的聲音,可以直接生成日文或西班牙文內容。這些都是官方頁面的說法,實際表現同樣建議用免費額度優先驗證。

對台灣讀者來說,這個責任配置值得停下來想。未經同意克隆他人聲音,在台灣可能同時踩到《個人資料保護法》(聲音若足以識別特定人,即可能落入個人資料的定義)與民法人格權保護的範圍;如果拿去做詐騙語音或假消息,刑事責任更重;同樣的警覺也適用於AI 換臉工具。平台端 Fish Audio 有設置檢舉濫用入口,也保留移除違反條款內容與帳號的權利,但「不預先審批」表示審核不會發生在你按下生成鍵之前。玩梗與出事之間的界線,由你自己判斷,出了事也由你自己面對。

條款還有幾個與一般使用者相關的細節值得知道:糾紛的管轄法律是美國加州法,並附帶強制仲裁條款與一年訴訟時效;帳號不得轉讓;不得用服務產出來訓練與 Fish Audio 競爭的模型;服務的營運主體是 Hanabi AI Inc.。這些條款生效日期停在 2024 年 8 月 18 日,兩年來產品線大幅擴張,條款本體沒有跟著改版,這在快速成長的 AI 服務裡並不罕見,但也代表條款與產品現況之間的縫隙會慢慢變大。

同一個官網,四個語言數字

評估一套多語言 TTS 的支援範圍時,你會在 Fish Audio 的官方頁面讀到四個不同的數字。GitHub README 寫「支援 80 種以上語言,中文、英文、日語列在第一梯隊」;S2 開源公告部落格寫「以約 1,000 萬小時、約 50 種語言的音訊訓練」;語音克隆頁寫「13 種語言零樣本跨語種克隆」;語音庫頁的篩選器提供 8 種語言。四個數字語境各不相同(訓練覆蓋、生成支援、跨語種克隆、素材庫篩選),但官網沒有任何一處把這四層關係講清楚,讀者很容易拿其中一個數字去回答另一個問題。

對台灣讀者最要緊的結論其實只有一條:中文在官方分級裡屬於第一梯隊,這一點四個頁面的口徑一致;至於繁體中文的生成表現,官方分級只標 zh、沒有繁體專屬的背書,建議用免費額度實測幾段再下定論。其餘語言的實際生成品質,官方 README 自己就把語言分成三級(第一級、第二級、全球覆蓋),沒有逐語言的品質承諾。

模型成績的部分也要用同樣的框架去讀。README 列出的基準測試成績:Seed-TTS Eval 的中文錯字率 0.54%、英文 0.99%,都是該榜單最佳;EmergentTTS-Eval 對 gpt-4o-mini-tts 基線的勝率 81.88%;Audio Turing Test 的後驗均值 0.515,高於 Seed-TTS 與 MiniMax 的同榜成績。這些數字全部是官方自報,榜單選擇與基線設定都出自單一方的手。可以把它當作「官方宣稱的水準」來引用,但不宜直接轉述成「公認最強」:開源界與商業界各自有評測流派,你自己的應用情境(台灣口音、中英混合、專有名詞)最終還是要用免費額度親自驗一次。

版本命名也有同樣的維護落差:線上服務目前由 S2.1 Pro 驅動(行銷頁標示),開源釋出的是 S2 Pro 權重,而定價頁 FAQ 裡還留著「S1 音訊」的舊說法。三代模型名同時活在官網的不同角落,對照文件時要留意自己讀的是哪一代的承諾。

免費加三個訂閱層的差別,集中在商用權與音色槽位

如果決定付費,各層之間真正有感的差異集中在三件事:能不能商用、有多少音色槽位、單次能輸入多長的文字。把定價頁的內容整理成對照:

方案月費(年付)積分/生成上限單次字數音色槽位商用
免費08,000 點/約 7 分鐘500 字3 個公開否
Plus15 美元(年付約 11 美元)250,000 點/約 200 分鐘15,000 字無限公開+10 個私有+1 個專業可
Pro100 美元(年付 75 美元)2,000,000 點/約 1,620 分鐘30,000 字無限+5 個專業可
Max999 美元(年付 749 美元)25,000,000 點/約 6,250 分鐘30,000 字無限+15 個專業可

免費版與 Plus 之間是最關鍵的一道檻:跨過去之後你拿到的第一個權利是商用授權,第二個是私有音色槽(公開音色會進入語音庫被其他使用者瀏覽使用,私有槽不會)。Pro 層開始有團隊席位(3 席起)與專業音色槽,並附 7 天無理由退款。另有聯繫銷售的 Enterprise 層,走按量計費,主打零資料留存、本地私有化部署與 SOC2 合規,適合有合規需求的組織。付費方式以國際信用卡為主,台灣讀者用 Visa 或 Mastercard 可以直接付款。API 屬於另一種計費(按用量),而且只開放給付費訂閱者。

順帶一提,站內另有兩個常被忽略的優惠入口:學生方案與新創方案,分別針對在校生與符合條件的新創團隊提供折扣,符合身分的讀者在付費前值得先繞過去確認資格。

Fish Audio 官網定價頁,四個訂閱方案卡片與常見問題Pin
Fish Audio 定價頁:免費版每月 8,000 積分,商用權從 Plus 方案開始。

順著語音庫往下走,會發現 Fish Audio 已經擴張成一個多工具平臺:文字轉語音之外,還有語音轉文字、變聲器、人聲分離、音訊翻譯、音效生成,甚至 AI 圖像與影片產生器。對讀者的好處是帳號與積分可能通用於整個產品線,代價則是每次改名與改版,舊文件就多留一層塵埃;前面提到的三代模型名並存,就是這種快速擴張的副作用。

免費試聽、Plus 商用、自架研究:三條路的分界

綜合授權、額度與硬體條件,三條路徑各有清楚的位置。只是好奇、想聽聽中文生成品質、判斷這個工具值不值得投入的人,用免費帳號就夠了,8,000 點積分足以讓你完整走一次從上傳樣本到生成旁白的流程,不用綁卡,不喜歡就離開。

要把語音變成作品的人(頻道旁白、有聲書、多語言配音),從 Plus 開始是合理的起點,這一層才解除商用限制,200 分鐘的月額度對每週產出一支十分鐘影片的創作者綽綽有餘,私有音色槽也讓你花時間調出來的聲音留在自己帳號裡;站方語音庫收錄的兩百多萬個聲音,許多正是創作者以公開槽分享出來的成果。往上到 Pro 或 Max 的判斷點很單純:你需要團隊席位(從 Pro 的 3 席到 Max 的 10 席)、需要更大的單次輸入,或者每月生成分鐘數超過 Plus 的上限。順帶修正一個容易搞混的細節:專業音色槽 Plus 就有 1 個,Pro 增加到 5 個、Max 到 15 個,這項資源並不是 Pro 才開始提供。

自架開源版則適合兩種人:研究與實驗用途(授權免費允許的範圍),以及具備談判條件、打算直接向 Fish Audio 購買商業授權的團隊。它不適合的,正是看到「開源免費」四個字就想繞過訂閱費的商業用途:那條路在授權條文與執行意願(他們明說會追究)兩邊都被堵住,而 24GB VRAM 的硬體成本攤下來未必比訂閱便宜。

最後一個提醒:克隆「自己的聲音」永遠是最安全、也最值得先做的起點:授權乾淨、沒有冒用問題,還能直接驗證克隆品質。克隆「別人的聲音」之前,先想清楚對方是否同意、使用時是否揭露。內容會不會造成損害,更是出事時最先被檢視的一環;這些關卡官方不會替你把關,出了事每一道都會算在使用者頭上。語音克隆技術本身已經便宜到人人都用得起,貴的是它背後的法律責任。Fish Audio 的結構設計,把這份責任原封不動地留給了使用者。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1768

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...