TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南
TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南

蛐蛐 QuQu 是開源中文語音輸入工具,用本機 FunASR 把口說轉成文字,語音處理全程不出電腦;AI 潤色層自帶金鑰、預設開啟,文字會送到你指定的端點。本文從原始碼攤開隱私邊界、Wispr Flow 定價現況、沒有安裝包的建置成本與專案凍結近一年的維護現實。
用 AI 摘要這篇文章:
先把你可能最想知道的三件事講完。它是免費的開源中文語音輸入工具嗎?是,GitHub 上 2,266 顆星(截至 2026 年 8 月),Apache-2.0 授權,軟體本身不收費。它標榜的「語音不出電腦」是真的嗎?翻開原始碼對照,音訊處理確實全程在本機,整個專案找不到任何統計或遙測元件;但辨識出來的「文字」如果開了 AI 潤色,會送到你自己填的雲端 AI 端點。那一般使用者下載就能用嗎?不行,它唯一發布過的正式版本連一個安裝檔都沒有附,想用就得從原始碼自己建置。
這三個答案其實指向同一件事:把蛐蛐當成裝好就用的現成軟體會失望,它更接近一台組裝好的引擎,燃料(AI 金鑰)要自己加,後續保養(維護)也要自己扛。以下先把該知道的界線攤開;辨識速度與準確率我沒有實測,安裝前請把它當成待驗證項目。
蛐蛐(QuQu)是 2025 年 9 月出現的桌面端語音輸入工具,Windows、macOS、Linux 三平台都標榜支援。按一下全域快捷鍵(目前版本實際生效的是 Cmd 或 Ctrl 加 Shift 加空格)開始說話,再按一下結束,辨識完成的文字自動貼到游標位置,這是它的基本使用循環。
它比較特別的地方是把「聽寫」拆成兩段獨立的處理。第一段是語音辨識:用阿里巴巴開源的 FunASR 套件組合三個模型,Paraformer-large 負責把聲音轉成中文字、FSMN-VAD 負責斷句、CT-Transformer 負責標點符號。翻開 funasr_server.py 這個檔案可以看到,三個模型跑在一個本機的 Python 子程序裡,透過標準輸入輸出跟主程式溝通,模型檔第一次使用時從 ModelScope 下載,之後存在使用者目錄的快取資料夾。
第二段是文字潤色。辨識出的逐字稿可以再送到一個 OpenAI 相容的 AI 端點,做格式化、糾錯、長文整理或摘要等六種處理。README 的例子是說了「週三開會,不對,是週四」,輸出會直接變成「週四開會」;口頭禪和填充詞也會被清掉。這是作者宣稱,不過對應的提示詞設計真的寫在程式裡:溫度設 0.3,明確要求保留語氣詞和原句結構、只刪填充詞、禁止把口語換成書面用詞,連「蠻不錯」這種台味口語都被點名不可以改成「非常好」。設計方向是「最小干預」,長文整理模式的提示詞裡另有一套分段與話題跳轉規則,實際清得多乾淨,要看你接的模型和那段提示詞的合作程度。
聽寫的成果會留在本機的歷史紀錄視窗,可以搜尋、複製、單則刪除,也能整批匯出成純文字檔。對把語音當輸入法的人來說,歷史紀錄就是備援:辨識錯了、貼錯地方了,回頭都找得到原文。
很多工具的隱私宣傳經不起原始碼檢驗,蛐蛐這半句倒是站得住。把整個專案的程式碼掃過一遍,程式運行時對外連線的對象只有三種:你自己填的 AI 端點、首次設定時從 Python 官網下載的執行環境、從 ModelScope 下載的模型檔。常見的遙測與統計 SDK 一個都沒有,翻遍依賴清單也沒有 Sentry、PostHog 這類元件;辨識歷史存在本機的 SQLite 資料庫,沒有雲端同步功能(建置打包階段另會從 GitHub 下載嵌入式 Python,不影響運行期的結論)。
換句話說,你說出口的聲音檔,在這個程式的設計裡沒有任何一條路可以離開你的電腦。對語音內容特別敏感的人,例如口述的內容涉及客戶資料、醫療紀錄或未公開的商業資訊,這個架構本身就是賣點。
附帶條件也要一起看。模型第一次要從 ModelScope 下載,那是阿里巴巴經營的模型庫,伺服器在中國大陸,下載速度與穩定性視你的網路環境而定,GitHub 上的 issue 也有人回報模型下載失敗或路徑抓錯的狀況。另外在 macOS 上,貼上文字的動作走 AppleScript 模擬按鍵,系統會要求你先開輔助使用權限,這是這類聽寫工具的標準代價,不算蛐蛐的缺陷。
語音辨識是真的本機,潤色層就是另一回事了,這也是整個工具最需要想清楚的地方。
蛐蛐不內建任何 AI 服務。沒填 API 金鑰的時候,程式會提示你先到設定頁面填金鑰,逐字稿原樣保留,聽寫功能照常可用;也就是說單用本機辨識、完全不接 AI,是一個完整可用的模式。填了金鑰之後,每段逐字稿的文字內容就會送到你指定的端點,預設是 OpenAI 的官方位址,設定頁也提供一鍵套用阿里雲 DashScope 的快捷配置。
還有幾個細節要留意。潤色開關在程式碼裡預設是開啟的,意思是金鑰一填上去,之後每段聽寫的完整文字預設都會出門,想只在本機處理要自己手動關掉。而且已發布的程式碼裡,AI 請求沒有逾時與重試保護,端點反應慢的時候它就是等;社群有人提交了加上 2 秒逾時與 3 次重試的修改,但一直沒有被合併進主線,這個細節下一節會有它的份量。
平心而論,這套 BYOK(自帶金鑰)設計比多數「免費工具偷偷把資料送去某個固定服務」乾淨:沒有綁定廠商、沒有內建金鑰、不潤色也能用,資料流向完全由你填的端點決定。但「隱私至上」的宣傳話術只涵蓋了語音那一半,文字那一半的邊界要由你自己劃。如果你的端點填的是 OpenAI,那段文字就到了 OpenAI;填的是公司自架的模型伺服器,就到了那台伺服器。工具把選擇權給你,也把判斷責任一併給了你。
還有兩個 README 的行銷說法,對照程式碼要打折扣。其一是「根據你當前的應用(寫程式、回郵件)智慧調整輸出格式」:程式裡沒有偵測前景應用再切換指令的邏輯,唯一讀取前景應用名稱的程式碼,用途是檢查 macOS 輔助使用權限。程式裡寫了超過 150 字自動改走長文整理的邏輯,但它掛在一條沒接上的路徑;實際聽寫流程不論長短都走一般優化,格式化、糾錯、摘要那幾組提示詞同樣寫了卻用不到,也沒有讓你自訂指令的欄位。其二是「準確識別並格式化 camelCase、snake_case 等編程術語」:同樣找不到對應的專門處理,辨識得出哪些英文術語,取決於 FunASR 模型本身的轉寫能力。對照著讀,README 更像願景文件,程式碼才是現狀。
蛐蛐的自我介紹就是「Wispr Flow 的開源免費替代方案」,README 的對照表把對方標成每個月 12 美元的訂閱。以 2026 年 8 月 Wispr Flow 官網定價頁為準,這個數字需要修正:Wispr Flow 有免費層,桌面端每週 2,000 字的聽寫額度;Pro 方案月繳是 15 美元,12 美元是年繳折算後的單價。對輕度使用者來說,對方本來就有免費額度可用,「改用蛐蛐省下訂閱費」這筆帳沒有宣傳裡那麼簡單。

| 對照項 | 蛐蛐 QuQu | Wispr Flow |
|---|---|---|
| 價格 | 免費開源 | 免費層每週 2,000 字;Pro 月繳 15 美元、年繳折算每月 12 美元 |
| 語音處理 | 本機 FunASR | 雲端服務 |
| 潤色模型 | 自選端點、自負費用 | 內建於訂閱 |
| 安裝方式 | 從原始碼建置 | 下載即用 |
| 維護責任 | 社群與你自己 | 官方團隊 |
把表攤開之後會發現,兩者真正的差異不在價格,在於你買的是產品還是引擎。Wispr Flow 是打開就能用的服務,官方標榜支援一百種以上語言,代價是語音上雲與訂閱費;蛐蛐只做中文,換來的是整套可控的處理鏈,代價是建置工、AI 流量費與維護責任。語音辨識品質誰高誰低,沒有實測之前我不下判斷,這也正是免費方案最需要自己驗證的部分。這條賽道上已經有好幾個開源挑戰者,OpenLess 走的是把口說整理成結構化 Prompt 的路線,同樣掛著 Wispr Flow 開源替代的招牌,選擇前值得一起看。
多數人對「開源免費工具」的期待是下載、安裝、開始用。蛐蛐在這一步會直接把不願意碰命令列的人篩掉。
它至今唯一的一次正式發布是 2025 年 9 月 22 日的 v1.0.1,而那次發布的附件清單是空的。發布說明自己承認:macOS 的預編譯包有程式簽署問題,無法正常開啟,建議使用者從原始碼自行建置,原本放在外部空間的下載連結也已經劃掉。這個專案從頭到尾沒有提供過一個能直接雙擊執行的安裝檔。

要把它跑起來,README 開出的條件是 Node.js 18 以上、pnpm、Python 3.8 以上,再走三條路徑之一:用 uv 自動管理 Python 環境(官方推薦)、自己建虛擬環境裝 FunASR 相關套件、或使用打包用的嵌入式 Python。模型另需下載,首次設定的下載量以 GB 計。macOS 上如果沒有 Python,安裝輔助程式還會自己從 Python 官網抓安裝包。這是一份寫給會用終端機的人的說明書,門檻不算兇悍,但每一步都在過濾非技術使用者。
已知的坑也有跡可循。README 寫的喚醒鍵是 F2,issue 裡也有人建議避開它,因為 F2 在 Windows 檔案總管是「重新命名」,邊聽寫邊改檔名會撞鍵;不過對照程式碼,目前版本根本沒有綁 F2,實際生效的是 Cmd 或 Ctrl 加 Shift 加空格,自訂快速鍵也還沒有開放。模型載入卡住、模型路徑偵測失敗同樣都有人回報。這些問題單獨看都不大,加在一起就是安裝體驗的真實樣貌。
蛐蛐的 GitHub 時間軸很值得整段看。2025 年 9 月 20 日建立專案,靠「Wispr Flow 開源替代」的定位快速累積到兩千多顆星;最後一次提交停在 2025 年 10 月 8 日,之後 main 分支就凍結了,到 2026 年 8 月已將近一年沒有新 commit。有個耐人尋味的細節:那最後一次提交,內容正是加上 node-gyp 依賴讓專案能在最新版 Node.js 上建置。等於停在「追上新版環境」的補丁上,下一個 Node.js 大版本再改掉什麼,就沒有人跟著修了。對一個必須從原始碼建置的工具,這是比功能缺陷更實際的長期風險。
凍結之後的社群狀態也看得出作者離場了。累積 53 個未關閉的 issue 與 pull request 裡,最連續的一串是微信群二維碼過期,從 2025 年 11 月一路有人留言提醒,到 2026 年 8 月還在開新的 issue,始終沒有人處理。至少六個 pull request 躺著未合併,內容包括修 FunASR 啟動的競態問題、避免模型載入時誤彈錯誤視窗、加上 AI 請求的逾時保護,都是有人寫好等著收的修正。貢獻紀錄也說明這實質上是一人專案:主要作者 26 次提交,另外四人各 1 次。
這段不是「專案已死」的判決書。程式碼完整、LICENSE 檔採 Apache-2.0(允許商用與修改,不過 package.json 另標成 MIT,兩處宣告並不一致)、模型與依賴都還拿得到,任何人都可以合法 fork 一份自己養。誠實的說法是:維護責任已經從作者轉移到每個採用者身上。用到一半遇到新版 macOS 或新 Node.js 出狀況,等上游修是不切實際的,你要嘛自己補,要嘛找到有人維護的 fork,要嘛接受它停在 2025 年 10 月的樣子。對個人玩家這通常可以接受,對想引進團隊的人這是必須先回答的問題。
三個都過,蛐蛐給你的東西確實少見:一條語音完全不出機器的中文聽寫管線,加上可以自由替換的潤色層,以及一份可以合法改造的 Apache-2.0 授權。同類型的選擇也值得並列比較:Input 0 是 macOS 上的開源語音輸入工具,同樣強調本機轉錄,它的 LLM 潤色層預設外送;FreeFlow 走按住 Fn 即時聽打的路線,也是開源專案;Speech-to-Markdown 則用 whisper.cpp 加本地 LLM 組出類似工作流,還分成 Mac 與 iPhone 兩個版本。這幾個專案共同的課題都一樣:辨識可以在本機完成,潤色的資料流向卻要每個人自己把關。
照 README 的快速開始走:複製專案、pnpm 安裝依賴、用 uv 建立 Python 環境、執行模型下載腳本、pnpm run dev 啟動。第一次跑通之後,先驗證這幾件事:把網路關掉再聽寫一段,確認辨識真的在本機跑(這是你自己就能做的最硬驗證);不填 AI 金鑰確認聽寫可用;填了金鑰之後,留意預設開啟的潤色會把每段文字送出門,需要時自己關。macOS 記得先在系統設定授予輔助使用權限,否則文字貼不上游標位置。
最後一句收斂:蛐蛐把「中文語音輸入可以完全不依賴雲端」這件事做成了真的,程式碼也攤在陽光下任你檢驗;它沒做到的是把這份能力包裝成人人可用的產品。引擎是真的,油錢和保養,從你決定採用的那一刻起就是你的了。