TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南
TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南

AI Podcast Transcriber 是開源的播客逐字稿工具,音訊在本機用 Whisper 轉錄、摘要走你自己的 OpenAI 相容 API。我讀完它的原始碼:作者主力已搬到星數多 13 倍的 AI-Video-Transcriber,這個倉庫自 2025 年 9 月起凍結,連「僅轉錄」模式也會把逐字稿送雲端潤稿,自架前該知道的邊界都在文中。
用 AI 摘要這篇文章:
在 GitHub 上搜播客轉錄,你很可能會遇到 wendy7756 的 podcast-transcriber:README 寫得完整、畫面截圖漂亮、Apache 2.0 開源、248 顆星,看起來就是一個可以直接自架的播客逐字稿工具。但這個倉庫有件事很少被提起:它的全部提交共 33 筆,功能性的改動停在 2025 年 9 月 1 日,之後唯一的一筆提交只改了 README。同一個作者在這個倉庫成立後第六天,另外開了一個 AI-Video-Transcriber,截至 2026 年 8 月已經累積 3,215 顆星,而且這個月還在持續推送。作者的商業產品 sipsip.ai 首頁上那句「超過 2,900 位開發者給我們的開源核心按過星」,連結指的也是新倉庫。

這不代表 podcast-transcriber 不能用。它是一個結構極簡的全端網頁應用:貼上播客連結,音訊在你自己的機器上轉成逐字稿,再呼叫你自己設定的 OpenAI 相容 API 做潤稿與摘要。整個後端就是一支 Express 伺服器加一支 Python 腳本,一個下午讀得完。只是在你決定把主力押上去之前,先把它和新倉庫的關係、資料怎麼流、平台支援到哪裡看清楚,會省掉不少冤枉路。
兩個倉庫的關係用一張表看得最清楚。舊倉庫做播客,新倉庫把範圍擴到影片與播客,而且補掉了舊版最卡人的幾個缺口:
| 項目 | podcast-transcriber(本篇主角) | AI-Video-Transcriber(後繼) |
|---|---|---|
| 成立與星數 | 2025-08-22,248 星、31 fork | 2025-08-28,3,215 星、409 fork |
| 提交狀態 | 共 33 筆,功能改動停在 2025-09-01 | 2026-08-23 仍在推送 |
| 輸入來源 | Apple Podcasts、小宇宙、RSS、直接音訊連結 | 官方列 30+ 平台,含 YouTube、TikTok、Bilibili,也支援本機檔案 |
| 轉錄策略 | 一律下載音訊、本機 Whisper 轉錄 | 有原生字幕的內容直接抓字幕,Whisper 是備援 |
| 模型設定 | 改 .env 檔,模型名寫死在程式裡 | 在介面上填 API 位址與金鑰,可自動抓模型清單 |
| 授權 | Apache 2.0 | Apache 2.0 |
新倉庫的能力清單來自它自己的 README 宣稱;但兩邊的星數、提交時間與 sipsip.ai 的連結指向,都是倉庫頁面上可以直接查證的事實。換句話說,如果你要的是一個持續維護、支援平台廣、模型可以在畫面上換的自架轉錄系統,我們先前介紹過的 AI Video Transcriber 是比較合理的選擇。那 podcast-transcriber 還剩什麼價值?它的定位變得很明確:一套只做播客、體積小、你可以在一個下午讀完全部原始碼再決定要不要信任的自架起點。對想拿它當 Whisper 實作範本、或只想處理 RSS 播客源的人,這個極簡反而是優點。
操作流程很單純。在網頁上貼連結,來源接受四種:Apple Podcasts 的節目頁、小宇宙的單集頁、任何標準 RSS 播客源,或直接的音訊檔網址(MP3、M4A、WAV、AAC、OGG、WMA 都行)。接著選兩個語言:音訊語言可以自動偵測或手動指定十種,摘要輸出語言有中文、英文、西班牙文、法文、德文五種。操作類型二選一:「轉錄並總結」或「僅轉錄」。處理時頁面要開著,進度用伺服器推送事件即時更新,完成後結果分三個分頁呈現:逐字稿、摘要,以及當摘要語言與偵測到的語言不同時自動產生的翻譯。

逐字稿出來之後還有一道整理,這是它與裸用 Whisper 最大的差別。README 對這道整理的說明是:修掉錯字與斷句、把多餘的語氣詞清掉、段落之間補上銜接,同時保留說話者的語言與表達習慣,不翻譯、不添加原文沒有的內容。這些承諾實際兌現到什麼程度,取決於你接的模型與設定,工具本身並不保證。
「本地轉錄」這四個字很容易被讀成「資料不出我的機器」,對照 server 目錄下的三支核心檔,實際的資料流要拆成兩層看。第一層是音訊:伺服器把音訊檔下載到本機的暫存目錄,交給 Faster-Whisper 轉錄,這一步確實不出機器,而且呼叫方式寫得非常死,是直接執行專案根目錄下 venv 裡的 Python。第二層是文字:逐字稿出來之後,程式把全文送給你在 .env 設定的 OpenAI 相容端點,模型名直接寫在程式裡,排版潤稿用 gpt-3.5-turbo,連續性優化與摘要用 gpt-4,條件翻譯用 gpt-4o。
最反直覺的一點藏在操作類型裡。你以為選「僅轉錄」就完全不碰雲端,但在單檔處理路徑上,逐字稿轉出來之後,程式照樣會把全文送去做排版潤稿,嘗試三次都失敗才保留原文,而且失敗前每次都要等上幾秒。想把全文留在本機,得靠一條繞路:金鑰整行不設的話,伺服器在啟動階段就會報錯,正確做法是把金鑰留成範本裡的佔位字串,讓每次雲端呼叫都被拒絕,程式才會退回原始逐字稿。這條路在程式結構上成立,官方文件並不把它當功能。另外摘要有一道寫死的天花板:程式註明 GPT-4 約 8,000 token 的上下文限制,超過 6,000 字的逐字稿會先分段處理再組合,兩小時以上的長節目拿到的是拼接出來的摘要,對完整度的預期要先打折扣。
檔案的去向也值得知道。音訊檔在處理結束後會被程式自動刪掉,但逐字稿與摘要是以 Markdown 檔的形態存進伺服器的暫存資料夾,沒有自動清理機制,會一直累積。潤稿成功時,原始逐字稿會先另存成一份備份檔,再把你看到的那份覆蓋成潤稿後的版本,所以事後要比對機器原稿與潤稿稿是做得到的。要留意的點在於:列出與下載這些檔案的兩支端點同樣不需要任何認證,只要能連到你的伺服器,就能翻看你產出過的每一份逐字稿。處理敏感內容的話,用完手動清空暫存資料夾是必要習慣。
授權方面倒是乾淨。LICENSE 檔是標準的 Apache 2.0 全文(附錄的年份欄位沒填,所以 GitHub 把它標成無法辨識的授權,實質就是 Apache 2.0),自用、修改、包進自己的服務都可以,記得保留聲明就行。
這個倉庫附了一份很少見的誠實文件 PLATFORM_SUPPORT.md,直接把支援程度分級:直接音訊連結與 RSS 源是完全支援;Apple Podcasts 是部分支援,靠 iTunes API 和頁面裡的 RSS 自動發現,直接貼單集連結不行,因為 Apple 的頁面不暴露音訊檔網址;小宇宙也是部分支援,官方自己寫明它的頁面有反爬蟲、API 可能需要認證;YouTube 音訊、需要登入的私有播客、有 DRM 保護的內容則明確不支援。對台灣聽眾的實際意思是:大部分節目都能在 Apple Podcasts 或 hosting 平台找到 RSS 源,貼 RSS 源永遠比貼 App 分享連結穩;聽 YouTube 談話節目的人,這套工具幫不了你,那是新倉庫的管區。
這份文件也留了一個時間差值得點出:文件寫「所有失敗都會回退到測試音訊」,但對應的下載程式碼裡,這個邏輯已經被註解掉,寫著不再使用假音訊備用方案,實際行為是直接回報下載失敗。也就是說亂貼連結不會有「隨便輸出一段」的僥倖,失敗就是失敗,換成正確的 RSS 源或直接音訊網址才是正解。
環境這關先過。README 列的前置需求是 Node.js 16 以上、Python 3.8 以上與 ffmpeg,另外要一個建在專案根目錄、名字就叫 venv 的虛擬環境,因為 Node 端寫死了呼叫 venv/bin/python 這個路徑。README 的維運提示很實用:第一次轉錄要下載約 75MB 的模型檔屬正常、遇到 500 錯誤先懷疑 venv 沒建好而非網路問題、記憶體建議預留 4GB。
介面有中英兩種語言,右上角能切換,也會跟著瀏覽器語言自動選,記在你的瀏覽器裡。不過中文版是簡體字,按鈕寫「轉錄並總結」「開始處理」,沒有繁體選項,看英文介面反而對台灣使用者更順眼一些。
伺服器本身沒有任何登入或認證,CORS 全開,連接埠被佔用就自動換下一個。在自己電腦上跑沒問題,但千萬別直接開到公網:區網或公網上任何人都能呼叫處理端點,用你的 API 金鑰燒帳單。要對外,前面自己加一道反向代理與認證。
成本結構要算清楚。工具本身免費,轉錄在本機也不花錢,但潤稿與摘要每一步都打你自己的 API,集數越多、節目越長,帳單線性成長。想在 .env 換成其他 OpenAI 相容服務可以,因為 API 位址是環境變數,但模型名寫死成 gpt-3.5-turbo、gpt-4、gpt-4o,你接的端點必須提供同名模型,否則要自己改程式。社群裡正好有一個 2025 年 12 月開著的 issue,請求把模型名參數化,至今沒有處理,這就是倉庫凍結的直接代價。
Windows 用戶還有一個未修的坑:2026 年 3 月回報的 issue 指出,轉錄其實已經完成、檔案也生成了,但 Python 在 Windows 主控台輸出時觸發編碼錯誤,整個任務被判定為失敗。同樣的問題在 macOS 與 Linux 上不存在的機率高,但如果你主力是 Windows,這筆帳要算進去。
整理成一個簡單的分流。你要的如果是一個讀得完、改得動、只處理播客的最小自架系統,順便當 Whisper 全端應用的學習範本,podcast-transcriber 仍然成立,只要接受它凍結的現實與上面這些條件。你要的如果是持續維護、支援 YouTube 與更多平台、有字幕就免下載音訊、模型在畫面上就能換,直接去 AI Video Transcriber,兩邊授權相同,前置需求也相近,新倉庫甚至少了 Node.js 這一項。你如果完全不想自架,作者的託管版 sipsip.ai 把同一套流程做成現成服務,還加了每日信件摘要與知識庫功能,免費就能開始,代價是你的音檔與文稿落在別人的伺服器上,而且它的資料處理條款要自己讀。至於只是想聽得更有效率、不一定要逐字稿的人,Readdig 這類 RSS 播客閱讀器 或 本機語音轉 Markdown 工具可能更貼近需求,不一定得架一套轉錄系統。
轉錄可以,Faster-Whisper 在本機跑,不需要任何金鑰。但潤稿與摘要需要 API 金鑰,而且在「僅轉錄」模式下程式也會嘗試送潤稿。實際做法是把金鑰留成範本裡的佔位字串,讓每次雲端呼叫都被拒絕,程式就會保留原始逐字稿;金鑰整行不設反而會讓伺服器起不來。這條繞路是從程式結構推出來的,官方沒有把它當功能。
貼節目頁可以,程式會透過 iTunes API 找出 RSS 源再抓音訊;直接貼單集連結不行,這是官方文件明寫的部分支援。養成習慣先找到節目的 RSS 源再貼,成功率最高。
官方文件的說法是部分支援:會先試小宇宙的 API,再回頭找 RSS,但頁面有反爬蟲、API 可能需要認證,官方自己都不保證。同一個節目若在其他平台也有上架,拿那邊的 RSS 源會穩得多。
在伺服器的暫存資料夾裡,一份是逐字稿、一份是摘要,都是 Markdown 格式,介面上也能直接下載。音訊檔處理完會自動刪除,文字檔不會,而且潤稿前的原始版本會多存一份備份。沒有背景清理,容量與隱私都要自己管理。
工具與轉錄都是零成本,花費全在你接的雲端 API:一小時的節目,逐字稿全文會先潤稿一輪,摘要再一輪,超過 6,000 字還會分多段呼叫再組合,若翻譯則再多一輪。實際金額取決於你選的模型與計價,架好後先用一集短節目試算,再決定要不要長期跑。