TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南
TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南

AI Speaker 標榜免費文字轉語音、可商用。實測免登入就能合成 MP3:聲音清單絕大多數來自微軟語音、經站方伺服器中繼,每次合成的文字還會存成伺服器紀錄;官網四套聲音數字對不上,台灣腔聲音掛著修復訊息。把資料流向看清楚再決定怎麼用它。
用 AI 摘要這篇文章:
免註冊免安裝,連 Email 都不用留,打開 AI Speaker 的繁中頁,貼一段文字按合成,十幾秒後播放器掛出一段可下載的 MP3。在一片要你先創帳號的免費文字轉語音工具裡,它把使用門檻壓到了最低,這是實測後最站得住的一個賣點。
不過往工具底下看,有兩件事會改變你怎麼用它。第一,它清單裡的聲音大多不是自家研發,絕大多數來自微軟的語音服務,合成還要先經過站方伺服器中繼。第二,你貼進去的每一段文字,都會被存成站方伺服器上的專案紀錄,掛在一個自動配發的匿名帳號底下。這兩件事,官方頁面都沒有明說。
這篇把動手測到的行為細節攤開來講:合成流程怎麼走、聲音從哪來、文字去了哪、官網四套規格數字怎麼對帳,以及台灣腔聲音目前的狀態。看完你會知道自己是把它當便利的小工具,還是要把整個工作流程搬上去。
實測當天直接開繁中版頁面(網址是 ai-speaker.net/tw,進 /zh 則是簡體介面)。操作面比預期乾淨:輸入區貼上測試句,預設聲音顯示 Jenny,語速、音調、音量各有一組調節控制,輸入框下方有即時字數計,會顯示 19/5000 這種計數。按下合成鈕,畫面不出現驗證碼,也不跳註冊牆,請求打到位於 ai-speaker.net 的合成端點,回應內容本身就是 MP3 資料(檔頭帶 ID3 標記與 LAME 編碼器字樣),瀏覽器把它組成音檔掛上播放器,旁邊就是下載鈕。

帳號機制值得單獨講。頁面一載入,站方就自動配發一個匿名帳號,我的兩個全新工作階段分別拿到 352375 號與 352389 號,號碼不同,代表每個無登入階段都是從一個新的空帳號開始,先前的專案不會跟著你。想把紀錄留在自己名下、用到多端同步,就得用 Email 或手機號碼登入。懶得登入又在乎紀錄的人,自己養成下載後另存的習慣比較實際。
從按下合成到拿到檔案的整段流程沒有遇到付費牆,這點給它公道:免費是真的免費,至少在合成與下載這條主路上如此。
介面本身是章節式的,這是它跟一堆單框轉換器最大的差別。官方的建議流程是加入新章節、貼文、配角色,逐章合成或一次合成全部章節;音檔可以整段匯出,也可以逐段落匯出,手機版照官方說法還能直接存進音樂資料夾。輸入區上排有停頓插入與字幕的開關,做有聲書或分角色的旁白稿時,這種結構比一次貼五千字實用。
官網行銷文字說它有媲美真人的情感表現,同一音色支援中英雙語、多語言混讀。聲音來源在頁面程式裡則有另一個版本的答案。站方自己的聲音清單 API 回傳的聲音,代碼壓倒性多數是微軟神經語音的命名:en-US-JennyNeural、zh-TW-HsiaoChenNeural、zh-CN-Xiaochen:DragonHDLatestNeural;資料欄位裡的類型名直接寫著 edge 或 azure(免費清單標 edge 的有 300 支,VIP 的 551 支標 azure),免費清單裡另有 28 支標成剪映的聲音。合成前頁面會先向站方要一組權杖,回應裡帶著 1-132.0.2917.0 這種微軟 Edge 版本字串,和一個名為 isEdgeOnlineOpen 的線上開關。程式裡甚至還留著一支直接呼叫微軟朗讀端點的舊函式,只是目前沒有被呼叫,聲音清單已改由站方 API 提供。
把幾條線放在一起看,架構就清楚了:聲音引擎主要來自微軟的兩條語音線(朗讀端的 Edge 與雲端的 Azure),AI Speaker 在前面加了一層自己的伺服器,以及一個章節式的編輯器介面。這種做法不孤單,站內先前介紹過的 Text2Voice 走的是直連微軟端點的路線,AI Speaker 則是把同一批聲音包進所見即所得的編輯流程,再補上字幕與影片匯出。差別落在資料路徑:直連路線裡你的文字直接送微軟;這裡文字先進南京實信達的伺服器,由伺服器向微軟取音,再回傳給你。
對多數人來說這層中繼沒有存在感,但它決定兩件事。其一,站方伺服器經手你的全文,看得到你合成的一切內容。其二,聲音供應鏈的最上游是微軟,端點政策一旦調整,影響不在你手裡,也不在站方手裡。
合成時打出去的請求順序很直白:第一支請求把整段文字送到合成端點;緊接著第二支請求,把同一篇全文連同聲音、語速、音調、音量設定,存成伺服器上的專案段落紀錄,掛在匿名帳號名下。也就是說,就算你只是隨手打一句話試音質,那句話也會留在對方的資料庫裡。這是「雲端合成」四個字的實際含義,只是多數工具不會把這句話講出來。
隱私文件本身寫了什麼?它說會收集暱稱、Email、性別、生日、頭像,語音轉文字功能需要麥克風權限,另外還有 Cookie、IP 位址、裝置識別碼等日誌資訊,並提到與合作夥伴及第三方 SDK 共用資料的可能。比較扎眼的瑕疵有兩個:隱私政策裡的第三方 SDK 清單只有一行標題,底下沒有列出任何一家;服務協議的退款段落還出現「退款完全由人工智能揚聲器自行決定」「致AI發言人」這樣的字樣,明顯是英文合約機器翻譯後直接上線,中間混了一段歐盟十四天退貨的模板文字。功能是真的能用,法律文件顯然沒有人校稿,這個落差本身就是一種訊號。
站內同類工具的文字流向可以對照著看:SAM TTS 那篇拆過同一個站三種 Sam 背後的文字去向差異,EasyVoice 則把小說轉有聲書時的文字外流代價講清楚。AI Speaker 的位置差不多:文字全出門,只是目的地換人。
講規格之前先對帳。首頁常見問答說有 320 多個 AI 主播、200 種語言;定價頁寫免費版 300 支以上聲音、50 種以上語言,VIP 則是 600 支以上聲音;而聲音與語言 API 給出的實際數字,是 79 種語言、328 支標為免費的聲音、551 支標為 VIP 的聲音。
| 資料出處 | 聲音數 | 語言數 |
|---|---|---|
| 首頁常見問答 | 320 多 | 200 |
| 定價頁免費方案 | 300 以上 | 50 以上 |
| 定價頁 VIP 方案 | 600 以上 | 50 以上 |
| 聲音與語言 API | 免費 328、VIP 551 | 79 |
四套數字沒有一套互相吻合,連官網自己內部都對不上。對讀者的實際意義有兩條:其一,「600 支聲音」是 VIP 欄位的行銷數字,免費能選的是 328 支;其二,「200 種語言」查無對應清單,語言 API 實際列出 79 種,中文底下再分普通話、香港粵語、台灣腔等變體。要挑聲音,以介面實際打開的清單為準就好,行銷頁的數字看看即可。
把聲音挑選視窗的語言篩選切到 Chinese,清單會列出 42 支免費中文聲音,其中台灣腔有三支:曉臻、曉雨、雲哲(對應微軟的 HsiaoChen、HsiaoYu、YunJhe)。問題是這些中文聲音項目上,掛著站方的英文訊息 The developers are repairing the malfunction!,翻出來是「開發人員正在修復故障」。這段字在頁面程式裡,是站方專為聲音故障準備的錯誤訊息;但同一批聲音在 API 裡的狀態欄又標著「正常」,而實測挑了曉臻送一句繁中合成,流程照樣產出長度合理的音檔。

三個訊號互相矛盾:介面掛修復中、API 標正常、實測能合成。我這輪的結論只能下到「中文聲音處於不穩定狀態」這個程度,沒有辦法保證你使用的當下是哪一種情況。建議的做法很簡單:要用中文聲音之前,先丟一句短句試播確認,沒問題再餵長文,別把五百字的稿子直接押上去。
另外有個第一次使用容易踩的坑:預設聲音是英文的 Jenny。你貼中文進去按合成,它不會自動幫你換聲音,實測就是用 Jenny 把整段繁中唸完的(有產出音檔,但用哪個聲音唸你的文字,品質差異自己試聽最準)。要中文打開聲音視窗、語言切到 Chinese 再選人,這一步別跳過。
免費版的限制寫得算清楚:單次合成建議 5000 字以內,次數不限,可以匯出 MP3、產生 SRT 字幕、插入停頓,聲音是三百支等級,沒有多情緒設定。官方常見問答對授權的說法給得很大方:音檔版權百分之百歸使用者,可用於任何目的,包括商業用途,只要符合當地法律。這句話出自站方自己的 FAQ,記得出處;畢竟聲音引擎是微軟的,這條商用授權鏈建立在站方的說法上,而不是一份你能拿去對質的微軟文件。
VIP 月繳 5 美元,或年繳 20 美元(官網自己換算約每月 1.67 美元),換到的是單次 30000 字、600 支聲音、多情緒設定與更快的信件支援。免費政策方面,官方明寫提供永久免費版,但保留未來調整政策的權利;退款條款則寫得相當保守,個案認定、可以拒絕,前面那段機器翻譯的「人工智能揚聲器自行決定」就是出自這裡。

四個端的現況:Chrome 擴充功能版本 1.2.0,2,000 名使用者、71 則評分平均 4.9 星,2026 年 6 月底有更新;Android 版在 Google Play 上 1,000 次以上下載,7 月初有更新,內含購買;iOS 版在 App Store 上架;Edge 附加元件的官網連結也在。官方對這些端的推銷點是多端同步、產字幕、匯出影片,以及每支聲音兩倍以上的合成速度。從頁面程式看,字幕與影片匯出是在瀏覽器端用 ffmpeg 的 WebAssembly 版本處理,這部分運算在你自己的機器上完成,不必上傳整支影片再等回傳,算是隱私面上少數的好消息,只是文字在合成那一步就已經送進站方伺服器了。
還有一個商店欄位值得記下:Chrome 商店把這個開發者標記為「未識別為交易者」。對台灣使用者這只是個欄位,但搭配個案認定的退款條款,付費前心裡要有個底。
把這篇實測到的限制集中起來看:
替代路線按需求分:想把文字的目的地拿回自己手裡,Text2Voice 的直連路線或 SpeakItAI 的自架 Azure 額度玩法都把選擇權還給你;要處理長篇小說轉有聲書,EasyVoice 的場景評測可以對照著讀。AI Speaker 的位置在「最快拿到 MP3」那一端:免登入免設定,介面又是章節式的,代價是把文字交給中繼伺服器。
如果你今天就要把幾段文字變成音檔,AI Speaker 是門檻最低的那一批:從開頁到下載不必留下 Email 或手機號碼,免費額度跑短文案和旁白草稿都夠用,拿來配社群影片也行。
三種情況建議繞道:文字內容不能外流;需要大量且穩定的中文長文合成,修復訊息與單一上游都是警訊;打算把成品當成商業產線的核心依賴,免費政策可調加上退款個案認定,風險都壓在你身上。這三種需求的共同解法是把引擎抓回自己手裡,直連或自架,而不是加購 VIP。
付 VIP 的合理場景只有一個:你已經用得很順,需要 30000 字長文與多情緒設定,並且接受文字繼續存放在對方伺服器。這個判斷跟工具好不好用無關,跟你的文字值多少有關。