EasyVoice 文字轉語音實測:小說變有聲書,先看清免費的代價

EasyVoice 是原始碼公開的免費文字轉語音工具,標榜把整本小說一鍵轉成有聲書,不用註冊就能開始。真正影響使用決策的是幾件事:免費的聲音來自微軟瀏覽器的朗讀端點、AI 選角會把全文送往你設定的 AI 服務、台灣華語聲音只有 3 個,加上倉庫未附授權條款,短文試聽、長期自架與全本機三種用法值得先分清楚。

用 AI 摘要這篇文章:

一段 27 個字的台灣華語文字,不用註冊帳號、不用裝任何東西,送出去 1.09 秒之後,回來的是一個將近 6 秒的 MP3 音檔。這是我在 EasyVoice 官方示範站上實際測到的數字,音檔格式 96kbps、24kHz 單聲道,內容長度跟字數對得上。它標榜把整本小說轉成有聲書,完全免費、沒有時數限制。

一個能把十萬字小說變有聲書的服務憑什麼免費、你的文字在過程中會流經誰、台灣讀者的聲音選擇夠不夠用,這三個問題比功能清單更值得先問清楚。EasyVoice 的原始碼公開在 GitHub 上,每一個答案都對得到檔案。

EasyVoice 官方示範站首頁,標題與立即體驗按鈕Pin
EasyVoice 官方示範站首頁(2026-09-15 截圖)

免費的聲音從哪來:微軟瀏覽器裡的朗讀功能

EasyVoice 的作者在文件裡寫得很老實,現在的免費語音合成主要透過 Edge 的朗讀服務提供。這句話翻譯成白話:它用的不是微軟開放給開發者的正式付費介面,而是 Edge 瀏覽器內建朗讀功能背後的那個服務端點。

原始碼裡的證據更具體。專案內附的授權憑證產生器會用一組固定的識別金鑰,加上取整到五分鐘的系統時間戳做雜湊,產生名為 Sec-MS-GEC 的通行權杖,並且把請求偽裝成 Chromium 143 版瀏覽器的身分。這正是微軟在朗讀端點前面加的那道門禁,社群裡各種免費朗讀工具都是靠同一套手法通關。也就是說,EasyVoice 的免費建立在微軟沒有承諾提供給第三方工具的通道上,通道一旦收緊,工具就得跟著改。

對照它自己的行銷文字,這裡有個值得停下來的落差。README 的技術段把語音引擎寫成 Microsoft Azure TTS,聽起來像正規軍;但同一份文件的 Tips 段又說目前主要靠 Edge 的免費服務。兩者共用同一批類神經聲音,走的大門不同:一個要付費金鑰、有官方保障,一個免費、隨時可能變卦。文件同時承認併發開太高會被限制,所以預設把併發上限設成 3,想加速的自行承擔風險。

這條免費通道現在還活著嗎?示範站上有個公開的任務統計端點,我查詢當天看到的是 423 個任務、423 個完成、0 個失敗。樣本不大,但至少說明近期使用的人都有正常拿到音檔,還沒有發生端點整片失效的狀況。順帶一提,這個統計端點連伺服器的記憶體用量都一併回報,站方對外暴露的營運資訊比一般服務大方,工程味很重,用起來倒是無妨。

你的文字會流經誰:三種用法的路線不一樣

EasyVoice 有三種用法,文字走的路線完全不同,怎麼選就看你要讓文字流經誰。

最省事的是直接用官方示範站。你貼上去的文字會先送到站方的伺服器,再由站方的機器轉送微軟端點合成聲音。示範站沒有提供隱私政策頁,文字會不會被留存、留多久,查不到任何說明。把短文、公開資料丟上去試聽沒問題;但如果是還沒出版的小說手稿或公司內部文件,這個未知要自己評估。

再往上一層是自己架。專案提供 Docker 映像檔,一行指令就能在自己機器上跑起來,產生的音檔和字幕會落在自己的硬碟裡。這解決了音檔落地的問題,但要注意合成這一步仍然連向微軟的朗讀端點,因為預設引擎就是它。GitHub 上有人回報在完全沒有對外網路的內網環境裡無法生成,討論區的回覆也證實了這一點:文字不出門,聲音就出不來。

要求最嚴格的是全本機路線。專案的引擎採外掛式設計,除了內建的免費引擎,也保留了讓自架聲音模型接進來的介面,原始碼裡對接的是名為 Kokoro 的開源語音模型,預設位置在本機的 8880 埠。想走到這一步,等於要自己再把另一個開源模型架起來,門檻明顯高了一截,也只有這條路能讓文字完全離不開你自己的機器。

另外還有一條容易忽略的支線:AI 智慧選角。這個功能會請大型語言模型替你的文章分段、分配角色和聲音,而它的實作是把輸入的完整內容連同聲音清單一起放進提示詞,送往你自己設定的 AI 端點。提示詞裡對模型的要求寫得相當細:按場景、角色、旁白切分文字,依角色性格從清單裡挑聲音,為每一段建議語速、音量和音調,而且交代不能漏句、不能調換順序,最後以固定格式回傳。這個端點要自填 API 金鑰,預設是 OpenAI,官方問答也建議可以換成其他相容服務。換句話說,開了這個功能,整份手稿就會交給你設定的那家 AI 服務;不設金鑰,就只有固定聲音可以選。資料私有跟 AI 處理私有是兩回事,整個專案的界線,就數這裡畫得最清楚。

順帶一提,選角的品質完全取決於你接的模型。官方問答自己承認,AI 配音效果不好時,能做的是換更強的模型,或者退回固定聲音;討論區裡也有人回報選角功能補全失敗的狀況。這條支線目前更像半成品,能用,但別把第一版結果當定稿。

台灣讀者的聲音清單:59 個聲音裡的 3 個

實測當天示範站回報的聲音清單共 59 個類神經聲音。聽起來不少,但拆開看就知道緊張在哪:台灣華語只有 3 個,兩女一男;中國大陸腔 6 個,隔天再查多出遼寧、陝西兩個方言變體,這份清單會漂移;廣東話 3 個;其餘是英文和其他語系。

3 個聲音對短文配音夠用,對長篇有聲書就是實際限制了。一本二十萬字的小說念下來,角色再多也只在 3 個台灣腔聲音裡輪替,聽感單調是可預期的。多角色功能真正的彈性在對岸腔調的聲音池裡,如果你的作品不介意混用不同的中文口音,選擇會寬很多;堅持全台灣腔,就要接受這個上限。我也比對過原始碼裡的聲音清單檔,台灣華語的數量同樣是 3,示範站沒有少給,這個專案收錄時就只有這 3 個。若瓶頸真的卡在聲音身上,另一條路是用 AnyVoice 這類聲音複製工具先做出自己的專屬聲音,再回頭配到文稿上,兩種工具解的是不同段落的問題。

值得一提的是它處理長文的方式。介面上貼完就能按生成,聲音採串流回傳,不需要等整本書轉完才能開始聽;生成的音檔旁可以同步產字幕檔,做影片的人拿得到時間軸。進階玩法是直接呼叫它的 JSON 介面,把小說對話逐句標好角色、聲音、語速、音調再送出,文件裡給的範例就是武俠小說對白,每個角色配不同聲音,連旁白的語速和音調都逐段指定。至於十萬字一鍵轉完這件事,官方這樣宣稱,我實測的規模只有單句,整本書的實際表現留給讀者用自己的稿件驗證。

EasyVoice 官方 README 的多角色生成畫面Pin
官方 README 展示的多角色生成畫面(來源:cosin2077/easyVoice 儲存庫)

原始碼公開,授權條款還沒寫上去

EasyVoice 在 GitHub 上有超過兩千三百顆星、三百多個分支,2025 年 3 月開張,Vue 3 前端加 Node.js 後端的 TypeScript 專案,程式碼結構乾淨,聲音引擎、語言模型選角、任務佇列各有模組。最近一次程式更新停在 2026 年 1 月,不過討論區到 9 月都還有人回報使用狀況,不算死專案,只是節奏放慢了。它沒有發過任何正式版號,部署以 Docker 映像檔或原始碼為準,這對自架的人代表一件事:更新與回滾沒有版本表可對照,抓最新映像檔就是唯一選項。

討論區的未回應清單還透露了幾個有聲書製作者會在意的缺口。有人問能不能在文字裡插入幾秒靜音或停頓,至今開著;有人希望生成時能加背景音樂,也還開著。想做章節間的呼吸感或配樂,現在都得靠後製自己處理,把成品當 podcast 經營的人得自己吃下這筆成本。

但有一件事要特別提醒:整個倉庫找不到任何授權條款。GitHub 的自動偵測顯示授權狀態是 None,專案自己的套件定義檔裡授權欄也是空的。原始碼公開不代表授權開放,沒有授權條款代表法律上預設保留所有權利,你可以看、可以抓回來自己用,但改作、散布或拿去商用,嚴格說都需要先向作者取得同意。個人品質的自架使用風險很低,公司專案或商業產品要採用它,這一步省不得。

從貼上到拿到音檔:兩種入口的實際操作

用官方示範站的流程短到不需要教學:打開網頁,把文字貼進輸入區,從下拉選單挑聲音,按生成,串流聲音幾秒內開始播放,完成後可直接下載音檔,需要字幕的把它一起勾了。整條路沒有註冊、沒有驗證碼,這也是它的介面留給人印象最深的地方。有個小地方先說在前面:介面本身是簡體中文,語言選單的預設值也停在對岸的聲音上,台灣使用者第一次進來記得先把語言切到繁體中文選項再挑聲音。要注意的是節流:以專案預設組態而言,每分鐘生成上限是 10 次,超過會被擋下來等下一個週期,示範站有沒有調過這個值,站方沒說。

EasyVoice 生成介面的聲音設定面板,含預設語音與 AI 推薦分頁Pin
生成介面右側的聲音設定面板,預設聲音停在中國大陸腔的雲希(2026-09-15 截圖)

自己架的人走的是同一套介面,差別在後面。Docker 一行指令起服務,把容器裡存放成品的目錄掛出來,生成的音檔和字幕就落在你指定的資料夾;要開 AI 選角,就在環境變數裡填上你選的 AI 服務位址、金鑰和模型名稱,重啟容器生效。專案給的說明也寫明了調速的兩個旋鈕:併發上限往上開可以加快整本書的生成,但開太高會被微軟端點節流,官方給的安全建議是 10 以下。

它也能當成網頁應用裝到手機或電腦上,這點我檢視示範站首頁的原始碼,安裝清單檔確實在。但要把兩件事分開:安裝到桌面的是介面,生成仍然是雲端的事,斷網狀態下能聽的只有已經生成完的音檔。有些介紹把它說成隨時離線使用,對照內網部署會失敗的回報,這個說法並不成立,挑工具時別被這四個字帶著走。

短文用示範站,長期自架,機敏內容走本機

把天花板放在一起看會更好做決定:台灣華語聲音只有 3 個、商用授權尚未標明、預設合成依賴微軟的非官方通道、示範站對文字留存沒有任何說明。這四件事加起來,就是決定你該站在哪個位置使用它的座標。

只是想快速把一段文字變聲音、內容也不敏感的人,官方示範站直接用,一分鐘內就能拿到音檔,這是我實測的路徑,也是它對一般使用者最平易近人的一面。要長期把小說轉成有聲書、音檔想留在自己機器上的人,走 Docker 自架,免費通道目前堪用,但心裡要有併發節流和端點政策改變的備案。文字完全不能出門、或追求長期穩定的商業使用,這條免費通道就不該是主力:要嘛自架 Kokoro 引擎換全本機,要嘛考慮走官方正式路線,像 SpeakItAI 串 Azure 免費額度做可下載音檔那類做法,責任歸屬清楚得多。兩者用的是同一批類神經聲音,真正的差別在出事時找誰:官方額度有帳號、有用量紀錄、有申訴管道,非官方端點的免費則隨時可以被收走,這是我在兩種工具上都實際走過之後,建議放進決策的權重。

判斷成不成功的標準也很具體:在示範站貼一段自己的文字,一分鐘內聽到聲音,這工具對你就算及格。失敗的處理順序同樣單純,速度慢就檢查併發設定,完全斷網就換自架引擎,AI 選角結果不理想就退回固定聲音。同場加映一個過來人視角:語音工具的世界裡,文字流向永遠比功能清單值得先問,之前實測 SAM TTS 時同一個問題就決定了它適合誰,EasyVoice 把三種路線都留給你選,算是同類工具裡少見的誠實設計。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1315

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...