Parakeet TDT 語音轉文字實測:模型免費能用,中文先繞道

Parakeet TDT 的行銷網站 parakeettdt.com 已變成域名停放頁,但 NVIDIA 開源的語音轉文字模型持續更新,官方免費示範頁仍可使用。實測把中文音檔丟進示範頁,7 秒回傳一頁拼湊的英文字而不報錯;本文拆解 60 分鐘 1 秒與 98% 兩個數字的真實條件,整理免費示範頁、本機 GGUF 與開發者三條可用路徑。

用 AI 摘要這篇文章:

如果你是循著「60 分鐘音檔 1 秒轉完、98% 準確率」這類介紹找上 parakeettdt.com,那個分頁可以先關掉了:現在點開它,看到的是一頁借貸、線上遊戲、旅館比價之類的廣告連結,跟語音轉文字毫無關係。但先別急著把 Parakeet TDT 從書籤刪掉,因為這裡其實有兩件事:那個網站只是包裝,真正做語音辨識的是 NVIDIA 開放出來的模型本體,而模型不但活著,還在 2025 年 8 月升級到支援 25 種歐洲語言的新版本。我實際把一段 10 秒的中文音檔丟進官方免費示範頁,7.4 秒後拿到一整段拼湊出來的英文字,過程沒有跳出任何錯誤提示。把網站與模型的現況分開看,你才會知道哪些音檔適合它、哪些音檔丟進去只會得到一頁看起來很像答案的垃圾。

先講結論。Parakeet TDT 值得認識,入口要換:行銷網站已經消失,請改走 NVIDIA 自己顧的免費示範頁,或者把模型抓到本機跑。你的音檔如果是以中文為主,這個模型不適合你,而且它不會告訴你不適合。

網站死了,模型沒死:先把兩件事分開

parakeettdt.com 現在的樣子是典型的域名停放頁。輸入網址後會被轉到另一個帶編號的子網域,頁面上排滿了熱門關鍵字連結,從小額借貸到音樂下載都有,唯一的語音相關內容是一條「parakeet-tdt-0.6b-v3」的殘留字樣,點了也只是再跳一輪廣告。這種頁面通常出現在域名易手或站方棄養之後,拿殘餘流量換廣告點擊。

parakeettdt.com 現在的域名停放頁,深色底畫面上列出貸款、音樂、線上遊戲與旅遊等無關的關鍵字連結Pin
parakeettdt.com 現在打開是一頁關鍵字廣告目錄,語音轉文字功能已不存在(來源:parakeettdt.com)

它不是無聲無息消失的。網際網路檔案館在 2026 年 4 月 19 日還存有一份完整快照:首頁掛著「Ultra-Fast Speech Recognition」的標語,列出三步驟使用流程、六張功能卡,還有六位掛著播客製作人、研討會主辦者頭銜的用戶見證。這種制式見證在模板行銷站裡很常見,人名與頭銜工整對仗,拿不出任何可查證的作品。換句話說,這個站從高峰到消失,中間只隔了不到半年。

Parakeet TDT 舊官網 2026 年 4 月存檔的功能卡區塊,標榜閃電速度、高識別準確率、自動標點與精準時間戳,下方為用戶見證卡Pin
舊官網 2026 年 4 月的存檔畫面:60 分鐘 1 秒與 98% 當時就寫在功能卡上(來源:網際網路檔案館存檔)

更要緊的是身分問題:parakeettdt.com 從來不是 NVIDIA 的官方服務,而是第三方拿開放模型包出來的網頁前端。模型本體放在 Hugging Face 上,名稱是 nvidia/parakeet-tdt-0.6b-v3,0.6B 指的是 6 億參數。第二代在 2025 年 5 月發布,只支援英文;第三代在 2025 年 8 月跟進,一次擴到 25 種歐洲語言,授權是允許商用的 CC BY 4.0。

模型這邊的活躍度也值得一提:第三代 2025 年 8 月上架,到現在一年多,光是最近一個月在 Hugging Face 的下載量就超過 72 萬次,專攻英文的第二代同期約 26.6 萬次,官方示範頁持續運作中,技術報告也發上了 arXiv。包裝站會死,開放權重不會,這是兩者最根本的差別;你收藏的應該是模型頁,不是任何一個前端的網址。

它憑什麼快:一個會自己跳過停頓的解碼器

要理解 1 秒轉 60 分鐘從哪來,得先知道 TDT 這三個字母在幹什麼。傳統語音辨識模型解碼時,多半每走一小段音訊框就吐一次字,講者停頓、換氣、咳嗽,模型照樣一格一格算過去。TDT(Token-and-Duration Transducer,字元與時長轉換器)的做法是讓模型在輸出每個字的時候,同時預測「這個字涵蓋了接下來多長的音訊」,一句話裡的停頓和拉長音可以直接跨過去,解碼步驟大幅減少,速度就是這樣省出來的。搭配的編碼器是 NVIDIA 自家的 FastConformer,整個模型 6 億參數,以現在的標準算是輕量級,官方給的最低需求只是 2GB 記憶體,記憶體越大能吃的音檔越長。

這也解釋了為什麼行銷頁敢寫「輕量部署」。模型檔案本體不到 3GB,量化版本更小,中階顯示卡甚至純 CPU 都有機會跑,只是速度會從幾千倍即時掉到幾倍即時。訓練素材方面,第三代用了約 66 萬小時從網路影音自動標記的多語資料,再混 1 萬小時真人校對過的錄音做最後調校,這種「機器標記為主、人工資料收尾」的做法,是它能把 25 種語言一次做齊的原因,也是乾淨朗讀與真實吵雜場景成績差距不小的原因之一。輕量是真的,極速是有條件的,廣撒 25 種語言也是。

「60 分鐘 1 秒」和「98%」:兩個數字的帳怎麼算

當年那個網站最吸引人的兩個數字,來源都可以在模型卡裡查到,但每個都有條件。「60 分鐘音檔 1 秒轉完」出自 NVIDIA 公布的效能數字:在語音辨識排行榜的評測硬體上、一次餵 128 段音檔的條件下,第二代模型測得的速度是音檔長度的 3,380 倍。60 分鐘除以 3,380,確實約等於 1 秒。問題是那是資料中心等級 GPU 的批次運算時間,你在網頁上傳一片 60 分鐘的錄音,光上傳和排隊就不止 1 秒,而多數人的電腦也跑不出那個倍率。數字是真的,但那是實驗室條件下的運算速度,你按下按鈕後等待的時間是另一回事。

「98% 準確率」也有一個具體出處:在 LibriSpeech 這個朗讀有聲書基準的乾淨測試集上,第二代模型的字錯誤率是 1.69%,換算準確率約 98.3%。但同一張表上的其他場域就沒有這麼漂亮:八項英文基準平均字錯誤率 6.05%,換算約 94%;會議逐字稿場域(AMI)是 11.16%,財報法說會場域(Earnings-22)是 11.15%,換算都只有約 89%。第三代的總平均是 6.34%,乾淨有聲書 1.93%。行銷頁把單一最佳基準寫成全面承諾,把「安靜書房裡的朗讀」的成績,借給了「多人會議室」的場景。

這裡還有個挑模型時用得上的細節:如果你的音檔清一色是英文,專攻英文的第二代在平均成績上其實略好於多語言的第三代(6.05% 對 6.34%),差距不大,但方向值得知道。多語言模型要用更多語言分攤容量,這是常見的取捨;反過來說,你的素材如果會混到法文、德文、西班牙文,第三代的自動語言偵測就值回票價,一段音檔裡換語言不用手動切。當年行銷頁寫的「OpenASR 榜單領先」也是同樣的閱讀法:第二代發布時確實在公開排行榜上衝到前面,但榜單成績都是特定基準、特定硬體下的數字,離「你的會議錄音 98%」還有一整段距離。

背景雜訊是行銷頁不會提的衰減條件。模型卡附有雜訊耐受表,在訊噪比 0 分貝(正常人聲與噪音差不多大聲)的環境下,平均字錯誤率從 6.34% 升到 11.66%;到 -5 分貝(噪音蓋過人聲)更升到 19.88%,等於每五個字錯一個。換成實際場景:咖啡廳隨手錄的訪談、風聲很大的戶外收音、多人同時講話的會議室,都會把成績往這個區間推。同一支錄音,先花五分鐘降噪或換離噪音源再錄,常常比換模型更有效。

中文音檔實測:它不會報錯,只會給你一頁自信的垃圾

這是我最想讓中文讀者知道的一段。Parakeet TDT 第三代支援的 25 種語言全部是歐洲語系,從英文、法文、德文到俄文、烏克蘭文,沒有中文、日文、韓文。我用系統內建的台灣中文語音合成了一段 10 秒的開會通知:「今天下午三點,我們在台北車站二樓開會,討論下一季的行銷預算,會後請把會議記錄整理成文字稿。」然後上傳到 NVIDIA 的官方示範頁。

7.4 秒後結果出來,沒有錯誤訊息,沒有「不支援此語言」的提示,介面上就是一列正常的轉錄結果:

Jingtiansa wu Sandian, Woman Tai Kai Bei Chu Jang Hai Lokai Hui, Tao Lui Sai Yi Jida Xing Xiao Yu Zuan, Hui Ho Ching Ba Hui Yi Ju Jang Li Chen Wen Zu Ga.

對照一下就會發現它在做什麼:「今天下午三點」變成 Jingtiansa wu Sandian,「台北車站」變成 Tai Kai Bei Chu Jang,「會後請把會議記錄整理成文字稿」變成結尾那串 Hui Ho Ching Ba Hui Yi Ju Jang Li Chen Wen Zu Ga。它聽到了中文的音,然後用自己詞彙表裡的歐語單字,把聽到的音節硬拼出來。這不是隨機亂碼,段落時間戳從 0.08 秒連續排到 9.92 秒,正好鋪滿整段音檔,看起來就是一份正常的轉錄結果。

NVIDIA 官方示範頁的轉錄結果表,一段 10 秒中文音檔被轉成拼湊的英文字串,時間戳標示 0.08 到 9.92 秒Pin
10 秒中文音檔在官方示範頁的轉錄結果:不報錯,直接輸出一串拼湊的英文字(來源:NVIDIA 官方示範頁)

往模型的構造裡看一層,原因很直白。這一代模型用的是一套只有 8,192 個 token 的共用詞彙表,為 25 種歐洲語言一起最佳化,裡面沒有任何中文字。模型有自動偵測語言的設計,但偵測的範圍只限於它認得的這 25 種,超出範圍的輸入不會被拒絕,而是被強行套進最近的模板裡,用歐語拼音把聽到的聲音交差。對它來說這是盡力而為,對你來說是拿到一份毫無用處卻一臉正經的輸出。

這種失敗方式比直接報錯麻煩得多。拿到一頁英文字的人如果不知道語言邊界,很可能以為是音質不好、口音太重或模型不夠強,換個檔案再試一次,永遠不會意識到問題出在「這個模型根本不認識中文」。更糟的情境是把這種輸出直接當成待校稿的初稿貼進文件。給你一個實用的排查順序:轉錄結果讀起來像外語拼音,先查模型的語言清單,再懷疑音質。日文、韓文我沒有測,但就模型的設計而言,所有不在支援清單裡的語言都應該當成同一種地雷看待。

現在要免費用它,走得通的三條路

最省事的是 NVIDIA 自己維護的官方示範頁。不用註冊帳號,上傳音檔或直接用麥克風錄音都行,介面是英文的,操作直覺:選 Audio File 分頁、拖入檔案、按 Transcribe。結果以表格呈現,每一段都標了起迄秒數,點任何一段可以回放那段音檔,校對時對著表格逐段聽很順,還能直接下載 CSV 與 SRT 字幕檔。要注意的是它跑在共享的 GPU 額度上:我同一天做第二次測試時就被額度擋下,這對匿名使用者是有上限的,常態使用建議登入 Hugging Face 帳號,或把重活移去自己跑。

想讓音檔不離開自己電腦,可以把模型抓回本機。模型卡直接提供量化過的 GGUF 檔案,搭配 NVIDIA 的 NeMo-Speech.cpp 原生執行環境,不需要 Python 環境也能在本機離線轉錄,適合隱私敏感的會議錄音或大批量音檔;示範頁那種「上傳後等結果」的流程,在本機版變成一行指令對著資料夾批次跑。這條路我沒有實際部署,指令與檔案名稱以模型卡的說明為準。開發者則有更順手的接法:用 NeMo 工具包或 Transformers 函式庫,幾行程式碼就能把模型掛進自己的流程,時間戳可以細到字元等級,做字幕對軸或搜尋定位都夠用,第二代模型另有官方 API 服務可用。

長音檔的處理能力也值得知道:單段全注意力模式下,這個模型可以一次吃進約 24 分鐘的音檔(在 80GB 記憶體的 A100 上),切換成局部注意力則可支撐到 3 小時。一般播客單集、演講錄影抽出的音軌都在涵蓋範圍內,一小時以上的長錄音要選對設定。

授權可以商用,但承諾要掛在對的地方

那個消失的網站曾經在常見問答裡寫著三個承諾:所有音檔在傳輸與處理過程加密、預設不儲存任何內容、轉錄結果可商用而且你保留完整所有權。這些話寫得很好看,但隨著網站消失已經無從兌現,而在站還活著的時候,一般使用者其實也沒有工具能驗證「不留存」是否為真。真正可以依賴的授權來源是模型本身:NVIDIA 以 CC BY 4.0 釋出,商業使用沒有問題,條件是註明出處。授權掛在開放權重上,不掛在某個前端的口頭保證上。

資料流向則取決於你選的路徑。用官方示範頁,音檔就是上傳到 Hugging Face 的基礎架構處理;走本機 GGUF,音檔全程不離開你的電腦。模型免費,跑模型的算力才是成本所在,這句話反過來讀也成立:你不用付錢的時候,要問的是處理發生在哪裡。

誰適合用,誰該繞路

適合用的情境很明確:你有英文或其他歐洲語言的音檔,要的是快速、免費、帶標點和時間戳的初稿,而且能接受每一百個字大約錯六個字(乾淨錄音會更好,會議室收音會更差),後續再人工校稿。舉個具體的例子:經營英文播客的人每集 40 分鐘,用示範頁轉出帶段落的初稿加上 SRT 檔,網頁版說明與字幕一次到位,校稿時間比從零聽打省得多;標點和大小寫是模型自動產生的,不用再跑後處理。相較於以雲端服務為主的同類工具,它的優勢是把模型本身開放出來,你隨時可以離線自己跑,不怕哪天服務改收費或直接下架,這正是這次包裝站消失而模型完好所驗證的事。

該繞路的人也一樣明確。中文音檔請直接換工具,站上有現成的選擇:想把手邊音檔轉成文字稿,可以看AI 播客轉錄工具的介紹Any2Text 這類多格式轉文字服務;想把語音邊說邊轉成輸入,LazyTyper 語音輸入工具支援中文辨識引擎;如果你要的是 Bilibili 影片抽逐字稿,bili2text 命令列工具是專門解這個需求的;做簡報配音則可以參考AudioTextHub 的文字轉語音實測。需要逐字稿等級精度的場合,記得用場域對應的錯誤率校正期待:會議類內容這個模型約 89% 的正確率,代表人工校對不能省。

精度要求高的英文工作流程,安排會是這樣:先用示範頁確認這個模型的錯誤型態你能不能接受,能接受的話,把常態處理移到本機版省去額度與上傳,輸出固定走 CSV 或 SRT 進你的校稿流程,最後仍然保留一輪人工檢查,重點放在人名、專有名詞和數字,這幾類是所有語音辨識模型共同的弱點。把它定位成「省掉八成聽打時間的初稿產生器」,比定位成「自動逐字稿」更貼近它實際的能耐。

最後回到那兩個漂亮的數字。它們沒有造假,只是被行銷頁搬離了原本的條件:1 秒轉 60 分鐘是資料中心批次運算的速度,98% 是安靜有聲書基準的成績。模型本身仍是目前開放授權語音辨識裡速度與品質都排得上前面的選擇,包它的網站來來去去,學會看數字背後的條件,比記住任何一個網址重要。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1185

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...