TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南
TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南

LibreTTS 是免費線上文字轉語音工具,輸入中文就能用 958 種微軟語音直接生成語音檔,不用註冊。本文實測生成速度、拆解免費的來源與資料流向,並附一行 Docker 自架教學,讓你看清楚這份免費適不適合自己用。
用 AI 摘要這篇文章:
先說結果:我把四個字交給它,0.31 秒後拿到一個 MP3。中間沒有註冊頁、沒有試聽次數用完的彈窗、沒有跟你要信箱的步驟。LibreTTS 是一個把文字變成語音檔的免費網頁工具,聲音用的是微軟的類神經語音,整份原始碼開源,想自己架一份也只要一行 Docker 指令。這篇把我實際測它、翻它的程式碼之後看到的事情攤開來講,包括這份免費是怎麼來的、你的字稿會經過誰的手,看完你可以自己決定要用公共站,還是架一份自己的。
我直接呼叫它的語音生成端點,選定「曉曉」這個聲音、送進「你好世界」,0.31 秒後伺服器交出 12,528 位元組的 MP3。用檔案工具驗證過,是貨真價實的 MPEG 音檔:24kHz 取樣、48kbps 位元率、單聲道。整個過程不需要金鑰、不需要登入,連滑鼠都不用動到註冊鈕,因為那個按鈕不存在。
聲音清單是我從它的語音列表介面逐一數出來的:共 958 個,橫跨 82 種語言代碼,英語最多有 211 個,中文相關 91 個,其中中國大陸 84 個(含東北、四川等幾支地方口音)、台灣 3 個(曉臻、曉雨、雲哲)、香港粵語 3 個,外加一個多說話人的 Dragon HD 新聲音。清單裡另有 59 個標著 Multilingual 的多語聲音,同一個聲音可以直接朗讀中英混雜的稿子,不用換人。這個量級在免費工具裡少見,多到介面必須附搜尋框讓你用名稱或編號過濾,而不是靠下拉選單慢慢翻。
生成前還有一個省事的小設計:試聽鈕只取字稿的前 20 個字做一次短語音,讓你先確認聲音挑對了沒有,滿意再按正式生成,長稿不必整篇重來。下載檔名走樸素路線,固定叫 voice 加上所選副檔名,要批次歸檔的人自己改檔名,會比期待工具幫你命名可靠。更懶的人可以連介面都不開:它的生成端點吃網址參數,把文字、聲音、語速寫進一條網址,瀏覽器貼上去就直接出聲,做書籤或嵌入別的流程都行。
它的程式架構裡其實內建了一道訪問密碼閘門,由站方用環境變數決定開不開。我查了它負責檢查密碼狀態的介面,公共站目前是關閉狀態,任何人打開就是全功能。

最值得拆開講的,是這份免費從哪裡來。
翻它的伺服器程式碼(src/lib/edgeTts.ts),每次生成語音前,它會先做一件事:向微軟的 dev.microsofttranslator.com 要求一組臨時端點授權。這個請求帶著名為 MSTranslatorAndroidApp 的簽章,簽章用一把 HMAC-SHA256 金鑰算出來,而這把金鑰直接寫在原始碼裡(第 164 行起的一串 base64 字元),跟著開源專案一起公開。取得授權後,它把你的文字包成 SSML(語音合成標記語言,一種告訴引擎怎麼讀的格式),送到微軟的語音服務端點,換播音檔。
換句話說,微軟對外開放的免費方案它一個都沒走,它借的是微軟翻譯 App 內部使用的那條通道。沒有人付錢,因為微軟沒有對這條內部通道收費;但也沒有任何契約保障,微軟哪天把門關上,工具不會提前收到通知。
站方自己也是這樣理解的。網站在引擎選項旁的說明文字寫的是「Edge API 請求應該不限次數」,連站長都只敢用「應該」兩個字,這個用詞比任何免責聲明都誠實。
這條通道確實壞過。2025 年 11 月有人上 GitHub 通報生成時出現「取得端點失敗,狀態碼 404」的錯誤,這個 issue 到今天還掛著沒關;而我這次實測一切正常。兩件事放在一起看,意思很清楚:通道會壞,壞了會修好,但沒有人保證下次壞多久。要拿它做正事的讀者,手上永遠該有第二個工具當備援。
輸出格式有四種(MP3、Opus、WAV、PCM),語速、語調、音量各有一個滑桿,數值直接對應引擎的 SSML 參數。字稿裡可以插停頓標籤,介面上有指定秒數的插入鈕,原理是在文字裡安插 break 標記,引擎讀到那裡就停一秒再繼續。工程上有個值得稱許的細節:送出前伺服器會把文字全部轉義,只放行格式精確的停頓標籤,想借標籤夾帶其他指令進語音引擎,會被擋在門外。
聲音的表現力比一般免費 TTS 多一層。以曉曉為例,我從它的語音詮釋資料介面逐項數過,共有二十種情緒風格可選:聊天、新聞播報、客服、愉快、生氣、冷靜等;部分聲音還支援角色扮演欄位,切換年齡感或性別感的音色。不支援這些功能的聲音,欄位會自動收起,不會讓你選了卻沒效果。
長稿的處理也做了功課。輸入框的計數器有自己的單位制:中文字一個算 2 單位、英數字一個算 1 單位、停頓每秒折 11 單位,上限十萬單位。換算成實際感受,一篇一千字的中文稿是兩千單位,離上限還很遠;會碰到上限的是整本書等級的字量,而超過五千單位的稿子會按標點符號自動分段,逐段生成再接起來。分段的優先順序有講究:先換行、再句末標點、接著分號與逗號,往字句深處才退讓,切出來的段落節奏跟朗讀的呼吸大致對齊。程式碼裡對停頓標籤也有保護,分段時把它當成不可切開的整體,不會切一半剩下半個標籤。
頁面右側有最近 50 筆的生成歷史,只存在瀏覽器的記憶體裡,關掉頁面就清空。這個設計等於宣告:你的生成紀錄不落地、不進資料庫,站方伺服器上沒有一個存放你字稿的地方。

用公共站時,字稿的路徑是:瀏覽器到 libretts.is-an.org(掛在 Cloudflare 後面,主機是贊助的 VPS),再到微軟。SSML 是在站方伺服器上組裝再轉發的,也就是說,站方伺服器看得到你的全文。有一個對它有利的事實要一起講:整個專案的依賴清單只有 Next.js、React 跟一個圖示庫,沒有任何資料庫或儲存引擎,伺服器收字、轉發、交出音檔,行程結束手上就沒東西了。「不留存」在這裡是架構事實,比寫在隱私政策裡的承諾更硬。不過架構不留存不等於每一層都不留,伺服器日誌、Cloudflare 的連線紀錄仍照一般網站運作,機密等級的稿子,標準答案依然是自架。朗讀一篇文章、做個影片旁白草稿,這條路徑無妨;換成未公開的內部文件,就該考慮下一節的自架方案。
它還有第二個引擎叫 OAI-TTS,是站長自架的 OpenAI 相容中繼站,同樣免金鑰。我實測同一組文字,它花 4.45 秒交卷,比 Edge 引擎慢了好幾倍,換到的是支援情感指示:你可以用一句白話描述想要的語氣,代價是停頓標籤在這個引擎上無效。兩個引擎各自的下拉選單切換,生成邏輯互不干擾。
再往深一層看,這個網站其實是個通用前殼。它內建了 OpenAI、矽基流動、ElevenLabs、MiniMax、Fish Audio、Google Cloud TTS、Azure 官方、火山引擎、GPT-SoVITS 的預設模板,也可以用自訂請求模板接任何 HTTP 語音服務。模板系統給了開發者足夠的螺栓:請求方法、端點與表頭都吃佔位符,字稿、聲音、語速、金鑰用雙花括號的變數填進去;答案端支援三種解碼(base64、hex、直接給網址),碰到送 JSON 而非音檔的服務,也能指定從哪個欄位取音。模板吃得到的服務名單裡甚至包含自架的 GPT-SoVITS,這代表它認真把自己定位成「配音桌」,引擎誰來都行。填好端點跟金鑰之後,有意思的事情來了:發音請求由瀏覽器直接打你填的端點,不經過站方伺服器,金鑰存在瀏覽器的 localStorage 裡。對自帶金鑰的人,這是它隱私設計裡最乾淨的一段:鑰匙不過站方的手。
兩個附帶提醒。金鑰在 localStorage 裡是明文,共用電腦上用完記得清;匯出配置檔會連金鑰一起打包,而且匯出檔名到今天還叫 ciallo-tts-apis-日期.json,這是它舊名字留下的活化石,把配置分享給別人之前,先開檔案把金鑰刪掉。
還有一個對開發者友善的細節:它的語音端點把 CORS 開成星號,任何網頁都能直接呼叫。想在自己作品裡嵌一個發音鈕,不用後端中轉,直接打它的 API 就行。當然,這條路同樣沒有穩定契約,正式產品別把命脈押在上面。
專案以 MIT 授權開源,用 Next.js 寫成,GitHub 上累積 217 次提交,最新版 1.3.0 是三天前才發佈的,維護狀態健康。官方 Docker 鏡像放在 GHCR,amd64 與 arm64 都有:
docker run -d -p 3000:3000 -e PASSWORD=你的密碼 --restart unless-stopped --name libretts ghcr.io/librespark/libretts:latest
一行起服務,要密碼保護就帶 PASSWORD 環境變數,第一次訪問輸入後同一台裝置記住,之後不再問。自架之後,字稿只進你自己的機器與微軟;想走官方付費通道,把自己申請的 Azure 金鑰掛進自訂 API 就行。不想碰 Docker 的人有更輕的選擇:fork 一份 repo 匯進 Vercel,平台自動認得這是 Next.js 專案,預設設定按下去就能部署。要注意 Vercel 的免費方案條款限個人非商業用途,公司內部要用的話,Docker 路線放自己的機器上比較沒有疑慮。
repo 的 384 顆星對著 336 個 fork,幾乎一比一,這個比例本身就是證據:多數人不是來按讚的,是真的架了一份在用。貢獻者清單上只有一位作者(Zwei),一人專案決策快、更新勤,這三天的版本跳升就是例證;壞處是長期依賴要有心理準備,好在它是開源的,最壞的情況就是社群 fork 接手。公共站的流量成本由 NodeSupport 與 YXVM 兩家 VPS 贊助扛著,這也是它敢把 API 大方開放的底氣。
TechMoon 先前介紹過幾個可以搭配看的工具。同樣走 Edge 語音引擎的 Text2Voice 是另一個入口,但它每小時限 10 次請求,LibreTTS 沒有這個緊箍咒;要走微軟官方通道的,Azure TTS 自架方案把金鑰與計費都攤在陽光下,適合正式用途;要完全離線的,Kokoro TTS 在本機跑模型,不依賴任何雲端。反方向的需求,把聲音變成文字,可以看 ReadLecture 語音轉文字。
LibreTTS 的位置很明確:打開網頁、貼上字稿、拿走 MP3,這三步之間沒有任何東西攔你。做影片旁白草稿、有聲書雛形、語言學習教材,公共站直接用,它是我見過門檻最低的免費 TTS 之一;字稿機密、要求穩定、或要接自己的 API 金鑰,一行 Docker 架自己的版本,把選擇權握在自己手裡。免費的形狀看清楚再用:它免費,是因為借了微軟的門,不是微軟請客。