VoiceCraft 文字轉語音實測:免費產 MP3,台灣口音這樣解鎖

VoiceCraft 是免費網頁版文字轉語音工具,不用註冊就能用 114 支微軟神經聲音產生 MP3,實測停頓指令誤差只有 0.016 秒。台灣口音不在選單裡,要用 SSML 模式貼 zh-TW 聲音名稱才叫得出來;語音轉文字的免費管道實測三次都失敗,本文攤開實測數據、解鎖教學與使用前該知道的限制。

用 AI 摘要這篇文章:

把稿子貼上去、按生成、下載 MP3,這三步在 VoiceCraft 上真的不用註冊帳號、不用綁信用卡。我直接對它的語音生成介面送出請求實測,回傳的是貨真價實的 MP3 音檔,重複測了幾次都成功。但它招牌上的另一半功能「語音轉文字」,實測當天三次上傳音檔全部失敗,伺服器回覆轉錄服務暫時無法使用。一個網站兩種遭遇,這篇把實測結果和口音解法一次講清楚,順便算清楚免費的代價。

先講結論:如果你需要的是快速把中文稿子變成旁白音檔,它打開就能用,值得放進書籤;如果你要的是台灣口音,直接用會失望,選單裡沒有半支台灣聲音,但有一條繞路能解(下面有可貼的範例);如果你主要想用語音轉文字,現階段別把重要工作壓在它身上。

不用註冊就能產 MP3,這半邊是真的

VoiceCraft 是一個免費網頁工具,位在 tts.wangwangit.com,主打文字轉語音與語音轉文字兩個功能。文字轉語音這邊,輸入方式有三種:直接貼文字、上傳純文字檔(上限 500KB)、或者貼一段 SSML 標記交給它直通處理。貼文字最適合短旁白與臨時配音,完整講稿走檔案上傳,進階的語氣控制靠 SSML,本文後面解鎖台灣口音用的就是它。

我實際送出生成請求,指定中文聲音「曉曉」,伺服器回傳 HTTP 200 與一個 13KB 的 MP3 檔,用工具檢查是 24kHz 單聲道的 MPEG 音檔,長度與文字量吻合。之後又換不同聲音、換中文的兩種地區口音各測了幾輪,全部成功,過程中不需要任何金鑰或登入。對照微軟 Azure 語音服務要申請帳號、綁訂閱拿免費額度的流程,這裡省掉的所有前置作業就是它的賣點。做影片旁白、有聲書、產品 demo 配音這類一次性的語音需求,入口成本等於零。以下所有數字與行為都以 2026 年 8 月的實測為準。

下載下來的就是一般 MP3 檔,可以直接丟進剪輯軟體。介面有中文與英文切換,速度與音調各附五個預設段位、也能用滑桿連續微調(速度 0.25 到 3 倍、音調正負 50Hz),聲音風格下拉選單有十一種,從新聞播報、客服專業到愉快歡樂都有,這些是微軟神經語音的表現風格參數。

VoiceCraft 官方網站的文字轉語音表單,包含輸入方式切換、文字輸入區、聲音選單顯示曉曉、語速與音調滑桿及語音風格下拉選單Pin
文字轉語音的完整表單:聲音、語速、音調、風格一次調整(圖片來源:VoiceCraft 官方網站截圖)

114 支聲音的實際清單,和官網數字對不上

語音生成工具最核心的資產是聲音庫,我把整個下拉選單逐支清點:實際內建 114 支神經網路聲音,分布在 11 個語言地區。中文有 21 支,全部是 zh-CN,也就是中國大陸標準腔的聲音,曉曉、雲希、雲揚這些名字都來自微軟的中文聲音家族;英文共有 29 支(美國 23、英國 4、澳洲 2);日文 7 支、韓文 8 支、法文 14 支、德文 15 支、西班牙文 17 支、俄文 3 支。

有趣的是官網自己的行銷文案還寫「90 多種聲音」,實際數字已經長到 114 支;「8 種語言」以語言別計倒是沒變,11 個是地區變體數。文案落後不是壞事,但評估工具時以實測數字為準比以官網數字為準可靠。

聲音家族的分布有實用資訊可挖。選單替 21 支中文聲音逐一標了氣質標籤:曉曉是溫柔、曉伊是甜美、曉辰是知性,男聲有雲希的清朗、雲揚的陽光、雲健的穩重、雲楓的磁性,挑聲音時等於自帶一份選角表。英文的美國腔 23 支含兒童聲音 Ana,做語言學習教材或兒童內容用得到。如果你做的是兩岸都能聽的中文內容,這些聲音直接就能上線;問題只出在台灣市場。

對台灣用戶來說,這份清單的關鍵缺口很明顯:沒有任何一支 zh-TW 聲音。直接選曉曉或雲希生成,出來的是中國大陸的標準口音,做台灣受眾的內容會立刻被聽出來。這不是聲音不好,是聲音不對。

台灣口音不在選單裡,SSML 模式繞得出去

選單沒有,不代表後端沒有。VoiceCraft 的第三種輸入方式是 SSML 模式,頁面說明寫得很直白:這個模式會把你貼的標記原樣送到微軟的語音引擎,支援 break、prosody、say-as 等標籤。換句話說,選單只是它預先幫你挑好的子集,引擎本身認得的聲音遠不止這些。

微軟的台灣聲音有三支:曉臻(zh-TW-HsiaoChenNeural,女聲)、雲哲(zh-TW-YunJheNeural,男聲)、曉雨(zh-TW-HsiaoYuNeural,女聲)。我把這三支都透過 SSML 模式實測了一輪,全部成功回傳 MP3。做法是切到 SSML 分頁,貼上這段:

<speak version="1.0" xmlns="http://www.w3.org/2001/10/synthesis" xml:lang="zh-TW"><voice name="zh-TW-HsiaoChenNeural">這裡放你的文字</voice></speak>

把「這裡放你的文字」換成稿子,想換男聲就把 voice name 換成 zh-TW-YunJheNeural。要確認成功,聽第一句就夠:曉臻念出來的是台灣口音的中文。如果回傳錯誤,通常是把聲音名稱打錯了,引擎會直接拒絕整段標記。

SSML 模式有兩個代價要知道。這個模式有 8KB 上限,長稿要自己分段;而且這個模式下方的速度、音調、風格選單會失效,要調整就得自己把 prosody 標籤寫進 SSML 裡,例如在文字前後包一層 prosody 標籤就能整段放慢。對願意多貼一段標記的人,這條路把這個工具從「中國大陸口音限定」變成「台灣口音可用」,價值差很多;對不想碰標記的人,拿一般模式配曉曉做草稿配音、成音交給後製處理,也是務實的分工。

停頓指令實測:說停 2 秒就停 2 秒

一般模式下它有一套自創的逐字稿指令,語法像這樣:[pause:500ms] 插入停頓、[emphasis:strong]重音[/emphasis] 標強調、[rate:slow]慢慢念[/rate] 改局部語速。頁面上的速查卡還列了音調、朗讀方式(把數字念成位數、把日期按格式念)、以別的說法替換縮寫等標記家族,全部走同一套中括號語法,不用學 SSML 就能控制節奏與語氣。這種標記式語法比直接寫 SSML 好上手,對剪輯節奏有要求的人是實戰功能。

VoiceCraft 官方網站的逐字稿指令速查卡彈出視窗,列出停頓、重音、語速、語調、情感風格等中括號標記語法Pin
逐字稿指令速查卡:停頓、重音、局部語速與情感標記(圖片來源:VoiceCraft 官方網站截圖)

我做了對照測試:同一段文字,不加指令生成是 2.664 秒;在中間插入 [pause:2s] 後變 4.680 秒,增加的 2.016 秒就是那個停頓指令換來的,誤差只有 0.016 秒。這代表指令確實有送進引擎處理,不是擺著好看的輸入框。實際做旁白時,句號之間補半秒停頓、重點詞加強調,出來的節奏感跟整段平念差很多,這也是它比「貼字進去直接生成」的陽春工具值得用的地方。

指令規則也寫得清楚:單次停頓最長 5 秒,整段文字總停頓上限 30 秒,全部指令最多 50 個;寫錯或沒閉合的標記不會報錯,會被原樣念出來,所以拼錯字自己要聽得出來。

超過 3000 字時頁面會提示耐心等待,並照每 1500 字約 2 秒的公式顯示預估時間;介面的錯誤訊息也預留了文字過長、請分段的情境,超長稿建議先自己切段再貼。

語音轉文字的免費,靠的是站長自己的額度

現在講實測翻車的那半邊。語音轉文字支援上傳音檔(上限 10MB,接受 MP3、WAV、M4A、FLAC、AAC、OGG、WebM、AMR、3GP 九種格式,以常見的 128kbps MP3 計算,10MB 大約對應十分鐘出頭的長度),介面上有一個「API Token 配置」區塊,兩個選項:用預設 Token,或填自己的 Token,而它自己的介面文案寫明這個 Token 屬於 SiliconFlow(硅基流動),一個以賣 API 額度為業務的中國雲端推理服務。

VoiceCraft 官方網站的語音轉文字分頁,顯示 API Token 配置區塊,可選使用預設 Token 或填入硅基流動自訂 TokenPin
語音轉文字的 Token 配置:預設共享管道或自帶金鑰(圖片來源:VoiceCraft 官方網站截圖)

我用預設 Token 這條路實測了三次,音檔格式換過 WAV 也換過 MP3,三次伺服器都回 HTTP 500,訊息是轉錄服務暫時無法使用。換句話說,「語音轉文字免費用」在測試當天是不成立的。我又故意填了一組假的金鑰做對照,這次回 HTTP 401、提示金鑰無效,代表伺服器確實會拿你填的金鑰去向後端驗證,問題出在預設那條共享管道,可能是額度用完,也可能是上游服務異常。轉出來的文字可以複製,也可以一鍵送回語音生成做二次配音,這個來回設計對會議紀錄轉旁白的工作流頗方便,前提是它要能轉成功。

這個設計其實把成本結構說得很明白:錯誤訊息與頁面文案都指向微軟的免費語音管道,這半邊實測也確實穩定;語音轉文字則要消耗雲端 API 額度,站長的共享額度一耗盡,免費就成了看運氣。需要穩定的轉文字,兩條路:辦一個自己的雲端金鑰填進去,或者改用 Frontend Audio to Text 這類瀏覽器端轉文字工具本機語音轉 Markdown 的離線方案,把處理留在自己機器上。

沒有條款、掛廣告的一人站,用之前心裡要有數

免費工具的帳單通常藏在別處,這裡有幾件事值得知道。

整個網站沒有隱私權政策、沒有服務條款,關於頁面也不存在,四個常見路徑全部回 404。你貼上去的文字、上傳的音檔會送到哪裡、存多久、有沒有日誌,沒有任何書面承諾。頁面上同時掛著 Google AdSense 廣告與 Umami 流量分析,前者是站長的收入來源,後者記錄頁面訪問。朗讀沒有敏感內容的稿子風險不大,但合約條款、客戶資料、未公開的商業文件這類內容,本來就不該經過一個零條款的第三方網站,這條界線畫起來很簡單:內容若不方便公開,就別貼進免費網路工具。

背景方面,這是一人開發者的個人站點。網域名稱屬於一個叫「一隻會飛的旺旺」的個人部落格,部落格導覽列把這個語音站列在「我的站點」選單裡,與導航站、短鏈站並列,是典型的站長 side project 組合。個人維護不是原罪,這個站至少從 2025 年 8 月就存在,2026 年 5 月還有改版紀錄,不是拋棄式專案;但它的服務水準沒有商業擔保,語音轉文字說掛就掛已經示範過一次,重要工作流不要單點依賴。

它的語音引擎是微軟的:頁面說明寫明 SSML 會原樣送進微軟語音引擎,實測出錯時,伺服器回的訊息也直接點名 Edge TTS。這解釋了它為什麼能免費,同時提示了長期風險:免費端點的政策一旦收緊,這類包裝站的成本結構會直接改變。同樣走微軟免費語音但以桌面軟體形式存在的工具,可以參考之前寫過的 Text2Voice Edge TTS,另有一篇 Voice Pro AI 配音工具 整理了 AI 配音的付費選項。

直接用,還是繞路

整理成一個簡單的判斷。你的需求是快速把中文或外文稿子變 MP3、對口音不挑剔或願意貼 SSML:直接用,它是目前上手門檻最低的免費方案之一,影片旁白、有聲書章節、產品 demo 的配音都涵蓋得到。如果你的目標是台灣口音:用 SSML 模式貼上曉臻或雲哲,多花三十秒換一個對的聲音,做給台灣觀眾的內容這三十秒不能省。若要的是穩定的語音轉文字:繞路,自帶金鑰或改用本機方案。內容涉及隱私的話:換工具,零條款的網站不該出現在你的工作流裡。

還有一種用法值得順手記下:無障礙朗讀。把長文件貼進轉成語音,給視力不便的長輩或自己通勤時聽,這種場景對口音寬容、對成本敏感,正好是它的甜蜜點。

免費工具的正確期待,是把它當成隨時可能變味的便利,重要的稿子永遠留一份原始文字檔。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 994

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...