Auto-Subs:本機 Whisper 字幕工具,把模型搬進你的 DaVinci

Auto-Subs 是 Tom Moroney 開發、MIT 授權的本機字幕工具,把 Whisper 模型搬進 DaVinci Resolve、Premiere Pro 與 After Effects,用本機顯卡跑、音訊不上傳雲端、不限時長。支援 100 多種語言、說話者分軌,模型從 80 MB 的 tiny 到 3.1 GB 的 large-v3 自選;硬體門檻建議 6 GB 以上 VRAM 才能順跑 medium 以上模型,Mac App Store 版 DaVinci 不支援必須改裝 Blackmagic 官網版本。

用 AI 摘要這篇文章:

很多在 DaVinci Resolve 裡剪片的創作者,遇到字幕這一關都會卡一下:用剪映或 Otter 雲端轉文字很準,但把字幕無損搬回時間軸要繞好幾步;用 DaVinci 內建的字幕功能又要重新聽打。Auto-Subs(github.com/tmoroney/auto-subs)就是補這個缺口的本機字幕工具,把 OpenAI 的 Whisper 模型整合進 DaVinci Resolve、Premiere Pro 與 After Effects,所有轉錄都在你自己的顯卡上跑完,不送雲端、不限時長、沒有月費。它本身用 Rust 綁定(whisper-rs)直接在本機跑模型,屬於那種「有顯卡的人,完全可以自己扛」的開源工具。

重點先看:Auto-Subs 是 Tom Moroney 開發、MIT 授權的本機字幕工具,把 Whisper、Moonshine、Parakeet 等開源模型塞進 DaVinci Resolve、Premiere Pro 與 After Effects,2026-07-21 剛釋出 v3.8.0、3,878 顆星、持續在更新。它支援 100 多種語言、說話者分軌、SRT 與文字匯出,模型從 80 MB 的 tiny 到 3.1 GB 的 large-v3 自選;要付出的代價是硬體門檻(建議 6 GB 以上 VRAM 才能順跑 medium 以上模型),以及 Mac App Store 版 DaVinci 不支援、必須改裝 Blackmagic 官網版本。

把 Whisper 寫進 DaVinci:Auto-Subs 的外掛機制差異化

Auto-Subs 是 Tom Moroney 從 2023 年開始維護、目前在 GitHub 累積 3,878 顆星、254 個 fork 的開源專案,授權是 MIT(forced-alignment 權重另外處理,下面會講)。技術堆疊不是 Electron,而是 Tauri + React + Rust,前端用 Radix UI 元件庫,後端把 whisper-rs(Whisper C++ 的 Rust 綁定)與 ONNX Runtime 包進同一支桌面 app。也因為是 Tauri,安裝檔比 Electron 同類工具小很多,macOS Apple Silicon、Intel、Windows(Vulkan/DirectML)、Linux 都有對應安裝包。

它的核心定位是「本機優先(local-first)字幕工具」,README 第一句就寫「No cloud, no subscription, no data leaving your machine」。依賴裡看不到 analytics、telemetry、Sentry、PostHog、Firebase、Amplitude 任何一條資料回傳函式庫;模型推理走 whisper-rs(GGML 格式)與 ONNX Runtime,所有音訊檔與轉錄結果都留在本機。這不代表它完全斷網,應用程式會抓 Tom Moroney 自己伺服器上的下載計數 badge(tom-moroney.com/release-tracker),用來在首頁顯示總下載量,這條連線會把你的 IP 送進他的伺服器 log,介意的人可以擋掉這個網域,字幕功能本身不受影響。

外掛整合是 Auto-Subs 最差異化的地方。DaVinci Resolve 在 Workspace → Scripts 選單底下原本就支援 Lua 與 Python 腳本,Auto-Subs 用這個官方機制把自己掛進去,不需要修改 DaVinci 本體或繞過簽章檢查;Adobe 端則透過 CEP extension(Common Extensibility Platform)掛載,所以 Premiere Pro 與 After Effects 開啟時,AutoSubs 面板會自動帶出。換句話說,它不是把字幕「生成 SRT 給你、你自己拖進時間軸」的獨立工具,而是直接在剪輯軟體裡長出字幕軌道,這對剪輯節奏的幫助很大。

跟 Otter、Descript 與剪映雲端字幕的根本差別

市面上做「語音轉字幕」的工具,背後的運算模型大致分三種:雲端 API(Otter、Descript、剪映雲端版)、瀏覽器 WebAudio(純前端音轉字工具)、本機 GPU(Auto-Subs、Whisper.cpp、faster-whisper)。雲端 API 準確度高、不用扛硬體,但每分鐘要付費、音檔要上傳;瀏覽器工具完全免安裝,但模型規模受限、長音檔容易撞記憶體;本機 GPU 工具要自己準備顯卡,但沒有時長上限、隱私邊界明確。Auto-Subs 屬於第三類,差別在於它把這件事做進 DaVinci 與 Adobe 裡,不用切換軟體。

跟它定位最近的「本機優先」同類,可以參考我們之前介紹過的 MioSub 開源 AI 字幕工具Input 0 開源語音輸入工具。MioSub 是「貼連結就出片」的網頁型字幕一站流程(轉錄、翻譯、對齊、壓制),Auto-Subs 則是「桌機外掛、長在剪輯軟體裡」,兩者目標讀者不同:MioSub 適合不想裝桌機 app、只想要一支壓好字幕影片的人;Auto-Subs 適合本來就在 DaVinci 或 Premiere 剪片、想把字幕這個環節也吃進自己工作流的創作者。如果你只是要快速把 YouTube 影片抓出逐字稿,AI YouTube Transcript 那種貼連結的雲端工具會比 Auto-Subs 更輕量。

維度Auto-SubsOtter / Descript剪映雲端字幕純前端音轉字
運算位置本機 GPU/CPU雲端雲端瀏覽器 WebAudio
收費模式免費(MIT 開源)月費 $16 到 24 美元剪映帳號自備雲端 API Key
隱私邊界音訊不上傳音訊上傳伺服器音訊上傳伺服器看選用 API 供應商
時長限制無(受本機硬體限制)免費版每月有額度看方案看瀏覽器記憶體
剪輯軟體整合DaVinci / Premiere / AE 原生外掛Descript 自帶編輯器剪映自帶編輯器
模型選擇Whisper / Moonshine / Parakeet自家模型(不公開)自家模型看 API 供應商
Auto-Subs 與常見雲端字幕服務比較(營運模式與檔案流向整理自各工具官方文件,截至 2026 年 7 月)。

兩種工作流:獨立模式與 DaVinci 模式怎麼選

Auto-Subs 啟動後第一個要決定的是走哪種模式。獨立模式(Standalone)就是一支桌機 app,把音訊或影片檔拖進去,選好模型與語言,按下 Transcribe 就會輸出 SRT、純文字或剪貼簿內容,全程不開 DaVinci 也行。DaVinci 模式則是 Auto-Subs 與 DaVinci Resolve 同時開啟,Auto-Subs 透過 Lua server 與 DaVinci 溝通,把你選的時間軸音訊抓出來轉錄,再把字幕以 Fusion macro 形式推回 DaVinci 時間軸,時間碼對齊在音訊上。Adobe 端的 Premiere / After Effects 透過 CEP extension 走類似的流程:Premiere 把字幕匯入為 caption track,After Effects 則把每段 SRT 轉成文字圖層。

如果你本來就在 DaVinci 剪片,建議直接走 DaVinci 模式,因為最省時間的環節其實是「把字幕無損同步回時間軸」,轉錄本身反而只佔一小部分。獨立模式等於還要自己手動把 SRT 拖進 DaVinci、對齊、套樣式,工作流斷點多。Adobe 用戶則要注意 CEP extension 必須在 Adobe 官方完整版才能跑,被盜版或精簡版的環境通常會缺 CEP 執行環境。Auto-Subs 另外提供 CLI 模式(autosubs --help),寫腳本批次處理整個資料夾的影片可以用。

Auto-Subs 轉錄介面截圖,顯示 Whisper 模型選單、語言選擇、說話者分軌與逐字稿編輯區Pin
Auto-Subs 轉錄介面,可切換模型、語言、翻譯選項,並編輯說話者標籤(截圖取自 tmoroney/auto-subs 官方 README)。

模型挑選:tiny、medium、large-v3 與 large-v3-turbo 的取捨

Auto-Subs 內建三個模型家族:Whisper(透過 whisper-rs 跑 GGML 格式)、Moonshine(Useful Sensors 的 ONNX 模型)、Parakeet(NVIDIA 的鸚鵡螺模型,同樣走 ONNX Runtime)。一般使用者最常用的是 Whisper 家族,README 把每個大小的模型對應的硬體需求列得很清楚,這裡直接引官方表格:

模型大小建議 RAM語言相對準確度
tiny / tiny.en80 MB1 GB多語 / 英文專用
base / base.en150 MB1 GB多語 / 英文專用
small / small.en480 MB2 GB多語 / 英文專用★★
medium / medium.en1.5 GB5 GB多語 / 英文專用★★★
large-v3-turbo1.6 GB6 GB多語★★★
large-v33.1 GB10 GB多語★★★★
Auto-Subs 內建 Whisper 模型對照表(整理自 tmoroney/auto-subs README,大小與 RAM 為約略值,準確度為 Auto-Subs 內部相對評級)。

實際選擇可以從三個角度拿捏。語言的部分,英文素材選 .en 結尾的變體,README 寫得很明白「英文專用模型在英文音訊上略準」;中文、日文、韓文這類非拉丁語系的素材,則不要用 tiny 與 base,因為這兩個小模型對 CJK 的字元級輸出很不穩,至少從 small 起跳。硬體搭配上,6 GB VRAM 的中階卡(例如 RTX 3060)能順跑 medium 與 large-v3-turbo,後者是 2024 年 OpenAI 推出的蒸餾版,準確度接近 large-v3、速度接近 small,是目前 most cost-effective 的選擇。large-v3 雖然最準,但 3.1 GB 模型加 10 GB RAM 的硬體門檻,會把多數膝上型電腦擋在外面。

說話者分軌(speaker diarization)是 Auto-Subs 與 barebone Whisper 工具的另一個差異。它在底層呼叫 pyannote-rs(Pyannote 的 Rust 實作),能標出「現在這段話是說話者 A 還是 B」,並在 Fusion macro 裡給每個說話者獨立的字幕樣式。這個功能對訪談型 Podcast、對談型 YouTube 影片幫助最大,單人 Vlog 用不太到。

Auto-Subs 主介面與進階設定,顯示模型大小、說話者分軌開關、翻譯選項與字幕樣式預設Pin
Auto-Subs 主介面,可開關說話者分軌、指定翻譯目標語言、套用字幕樣式 preset(截圖取自 tmoroney/auto-subs 官方 README)。

限制與風險:硬體門檻、MMS 授權與 Mac App Store 警告

用一套本機 AI 工具前,硬體與授權兩條線都要看清楚。硬體門檻最先碰到:Auto-Subs 的模型大小直接綁 VRAM/RAM,small 以下 4 GB 卡能跑,但 medium 以上要 5 到 10 GB,Apple Silicon Mac 因為統一記憶體,16 GB 機種能跑到 large-v3、8 GB 機種建議停在 small。Intel Mac 在 2026-07-21 那次 v3.8.0 的 commit 裡被特別修了一個 bug,舊版在 Intel Mac 上會強制走 Metal 後端導致 abort,新版改成 CPU-only,所以 Intel Mac 用戶速度會比 Apple Silicon 慢一截,這是已知限制不是 bug。Linux 用戶要用 NVIDIA 卡走 CUDA、AMD 卡走 ROCm,內顯跑不動 large-v3。

授權分層是另一個容易混淆的地方。Auto-Subs 的「程式碼」是 MIT 授權(Copyright (c) 2023 Tom Moroney,LICENSE 在 repo 根目錄),可以商用、修改、再散布;但模型權重不完全一樣:Whisper 本身是 Apache 2.0、Moonshine 與 Parakeet 各自走自己的授權,README 的「Model licensing」段另外標明:optional 的 MMS forced-alignment 權重是從 Meta 的 MMS 模型轉換而來,以 CC BY-NC 4.0 提供,禁止商業使用。所以如果你要把字幕工作流用在商業專案,轉錄本身(Whisper)沒問題,但開啟 MMS forced-alignment(用途是更精細的字級時間碼對齊)就走進非商業授權領域,要自行確認。Auto-Subs 的 Model Manager 把這些模型分開下載、不會預設綁在一起。

DaVinci 版本限制是 macOS 用戶會踩到的雷。README 在 DaVinci 整合段標了一個 WARNING:「Mac App Store version not supported – download DaVinci Resolve from blackmagicdesign.com instead」。原因是 Mac App Store 版 DaVinci 因為沙盒限制,不允許第三方 Lua server 連線,所以 Auto-Subs 的 DaVinci 模式對它無效。如果你原本裝的是 Mac App Store 版,必須改裝 Blackmagic 官網的 .dmg 版才能用 DaVinci 模式;獨立模式(Standalone)不受影響。

語言支援的邊界則是處理低資源語言時會碰到的限制。Auto-Subs 號稱支援 100 多種語言,但 README 在 Model licensing 段老實寫了:「MMS 雖然支援上千種語言,但字級對齊(word-level alignment)需要先用 uroman 把文字羅馬拼音化,uroman 雖然涵蓋拉丁、西里爾、阿拉伯、CJK 與大部分印度語系,但少數極低資源少數民族的文字不在它的資料裡,可能產出不精準或缺漏的字級時間碼」。對主流語言(中英日韓歐語系)沒影響,但若處理的是原住民語或低資源方言,就要把這條算進去。

專案活躍度這條也要算進去。Auto-Subs 的 v3.8.0 在 2026-07-21 釋出,主打 MMS forced-alignment 字級時間碼、Resolve 在非英文 locale 匯出音訊誤判失敗的修正與設定對話框可讀性;同日 main 分支陸續合併 Intel Mac 強制 CPU-only 避免 Metal abort(PR #693)、Resolve 匯出 render job list 空值防護(PR #692)。最近半個月合併 10 個 PR、發了 2 個版(v3.7.0 與 v3.8.0),屬於仍在積極維護的專案;作者 Tom Moroney 同時維護 tom-moroney.com/auto-subs/ 官網與 Buy Me a Coffee 贊助頁,沒有走 SaaS 化收費路線。不過開源專案的活躍度會變動,下載前到 repo 首頁看一下最近 commit 時間比較保險。

適合誰、不適合誰

適合的人:最直接的受眾,是本來就在 DaVinci Resolve 或 Premiere Pro 剪片、需要常態產出字幕的創作者,尤其是訪談、對談、Podcast 類型,Auto-Subs 的說話者分軌與剪輯軟體原生整合能省下可觀的後製時間。另一類是隱私敏感素材的處理者,例如企業內部訪談、未公開產品 demo、醫療或法律性質錄音,這類素材不能上雲端,本機 Whisper 幾乎是唯一選項。還有一類是高頻長素材創作者,每個月雲端字幕訂閱費 $20 美元起跳的人,自有顯卡跑 Auto-Subs 幾個月就回本。

不適合的人:沒有獨立顯卡、只用 Intel UHD 或 Apple MacBook Air 8 GB 機種的人會被卡住,能跑的模型上限是 small,準確度會比雲端 Otter / Descript 低一截,沒有省到訂閱費的意義。只偶爾需要一支字幕、不會常態產出的人也不太適合,安裝桌機 app + 模型 + 設定 DaVinci 整合的成本,比用 AI YouTube Transcript 那種貼連結雲端工具高太多。需要最高準確度的專業場景(法庭逐字稿、醫療聽打)也不建議,目前開源 Whisper 的最後一段準確度仍跟不上人類聽打或專業雲端服務,這類需求建議走人工校對或付費服務。

三個可以立刻執行的下一步

1. 先用獨立模式試水準確度,再決定要不要裝 DaVinci 整合。GitHub Releases 下載對應平台的安裝包(macOS 也可用 brew install --cask auto-subs),啟動後丟一段 5 到 10 分鐘的自己素材,模型選 large-v3-turbo(6 GB VRAM 起跳),跑一次看錯字率。判斷標準:中文錯字率 5% 以下、英文 3% 以下,就值得投資整合工作流;超過 10% 就先檢查音質或換模型。

2. 確認 DaVinci 是 Blackmagic 官網版而非 Mac App Store 版。macOS 用戶打開 DaVinci Resolve → Workspace 選單,看底下有沒有 Scripts 子選單;如果沒有,或你確認是 App Store 版,到 blackmagicdesign.com 下載 .dmg 版重新安裝(兩者可以共存,但只有 .dmg 版能跑 Auto-Subs 整合)。完成後重開 DaVinci,再到 Workspace → Scripts 找 AutoSubs,這個名稱出現才算掛載成功。

3. 評估要不要開 MMS forced-alignment。如果你只做商業內容、不在乎字級時間碼精度,在 Model Manager 裡略過 MMS 權重下載,全程使用 MIT + Apache 2.0 授權的 Whisper 就好;如果你做的是字幕精修、需要每個字獨立時間碼(例如卡拉 OK、學術語料庫),就下載 MMS 但要記得它的 CC BY-NC 4.0 限制,相關產出不能商用。

常見問題

Auto-Subs 跟 faster-whisper、Whisper.cpp 這類本機 Whisper 工具有什麼不一樣?

它們都跑同一個 Whisper 模型,差別在工作流。Whisper.cpp 與 faster-whisper 是 CLI 工具,輸出 SRT 之後要自己想辦法搬進剪輯軟體;Auto-Subs 把轉錄、說話者分軌、字幕樣式 preset、剪輯軟體整合全部做起來,等於「Whisper 引擎 + 剪輯軟體外掛」一體成型。技術上 Auto-Subs 的 Whisper 也是透過 whisper-rs 跑 GGML(跟 Whisper.cpp 同源),所以準確度不會有差距,差距在 UI 與整合。

中文轉錄的準確度大概在哪?

Auto-Subs 沒有公開官方中文測試資料,社群普遍反映 large-v3 在乾淨錄音的普通話素材上可以做到 90 到 95% 字元級準確度,粵語、台語、口音較重或背景音嘈雜的素材會降到 70 到 85%。這組數字是開源圈跨多篇測試整理出來的量級而非絕對值,建議用自己實際素材測一次再決定。比較基準可參考 純前端音訊轉文字工具Input 0 本機 Whisper 兩篇的討論。

可以拿來做卡拉 OK 字幕或字幕組嗎?

技術上可以,但要看素材與授權。卡拉 OK 字幕需要字級時間碼,要開 MMS forced-alignment,而 MMS 是 CC BY-NC 4.0、不能商用;字幕組翻譯別人的影視作品則涉及原作品版權,Auto-Subs 工具本身不會阻擋,但使用者要自負授權責任。

商業頻道可以用 Auto-Subs 嗎?

Auto-Subs 程式碼是 MIT,可以商用;Whisper 模型是 Apache 2.0,也可以商用;只要不開 MMS forced-alignment(CC BY-NC 4.0)這條路徑,商業內容產出沒有授權問題。Adobe 端使用者還要確認自己用的是合法授權的 Creative Cloud 訂閱,CEP extension 是 Adobe 官方外掛機制、不會繞過 Adobe 本身的授權檢查。

FreeCut 瀏覽器影片剪輯器這種本機優先影片工具比,定位差在哪?

FreeCut 走純瀏覽器 WebCodecs,檔案不上傳但模型選擇受限、長影片會撞瀏覽器記憶體;Auto-Subs 走桌機 Tauri + 本機 GPU,能跑的模型大得多、長影片不受瀏覽器限制。兩者不是競爭關係,FreeCut 適合不願裝桌機 app 的人做輕量剪輯與字幕,Auto-Subs 適合有剪輯軟體工作流的進階創作者做長片後製。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 702

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...