OpenUtau 開源歌聲合成編輯器,用 UTAU 音色庫不必改系統地區

OpenUtau 是 2014 年起步的免費開源歌聲合成編輯器,直接使用 UTAU 社群音色庫,Windows、macOS、Linux 都能跑,不必再改系統地區設定;本文整理它的編碼機制、AI 本機推論與安裝門檻。

用 AI 摘要這篇文章:

想做虛擬歌手的歌,華文圈使用者撞到的第一道牆常常不是軟體要錢,而是原版 UTAU 假設你的電腦就是日文環境。把 Windows 系統地區切成日文、或掛轉區工具再開專案,是那個年代做歌的人的共同記憶。OpenUtau 是 2014 年起步的免費開源歌聲合成編輯器,用 MIT 授權釋出,直接吃 UTAU 社群十幾年累積的音色庫資產,跑在 Windows、macOS、Linux 三個平台上。它不是冷門實驗品:GitHub 上有 4,302 顆星,原始碼幾乎天天有提交。只有一件事要先講清楚,它安裝完一個聲音都不帶,聲音要自己找。這篇帶你看它到底解決了什麼、機制藏在哪、下載安裝前該知道哪些門檻。

原版 UTAU 官網還活著,但時鐘停在另一個年代

UTAU 的官方下載頁到 2026 年 9 月還開著。最新版是 2024 年 5 月的 v0.4.19,內容是安全性漏洞修正;再往上一版 v0.4.18e,日期是 2013 年 9 月。中間超過十年沒有版本。它的 zip 版本還註明要另外裝 VB6.0 runtime,那是上個世紀的基礎元件。更有味道的是,這個官方網頁本身用 Shift-JIS 編碼寫成,你用非日文環境的預設解碼去看,整頁就是一片亂碼,編碼問題從官網開始就是這個生態的日常。

OpenUtau 是同一個賽道上的另一種活法。專案 2014 年 11 月出現在 GitHub,版權宣告掛著 StAkira 的名字,十二年後的今天仍在滾動:beta 0.1.568 是 2026 年 3 月的版本,更新的 beta 0.1.569 在 9 月初跟上,alpha 測試版一週數版,背後是每天排程跑一次的自動建置;最新穩定版反而停在 2025 年 9 月的 0.1.565,開發主力明顯都在測試通道上。倉庫從個人帳號搬進 openutau 組織,舊連結自動轉址,551 個 fork、140 個開著的議題與合併請求,最近一次互動就在昨天。

兩者並排看會更清楚:

原版 UTAUOpenUtau
平台僅 WindowsWindows、macOS、Linux
授權免費軟體,未開源MIT 開源
近期節奏2013 年後一段長空白,2024 年一次安全修正穩定版停在 2025 年 9 月,beta 與 alpha 持續滾動
額外依賴zip 版需 VB6.0 runtime.NET 執行環境
官方資源日文下載頁(Shift-JIS 編碼)英文官網、多語 wiki、Discord 社群

編碼這一關,它在軟體層解掉了

原版 UTAU 的地區設定之痛,OpenUtau 官方常見問題把它描述成兩個具體問題:音色庫壓縮檔裡的檔名編碼,以及 oto.ini 這類文字檔的內容編碼。日文音色庫傳統上用 Shift-JIS,而中文、韓文根本塞不進這套編碼,於是非日文系統上檔名與別名就成了亂碼。

OpenUtau 的解法可以直接在原始碼裡找到。載入 .ust 專案檔時,程式會先讀檔案前 10 行,找有沒有 Charset= 這行宣告,有就照宣告的編碼解析,沒有就退回 Shift-JIS。音色庫安裝器再多做一步:安裝時讓你預覽解出來的檔名與文字內容,確認編碼選對了才繼續。官方文件的說法很實在:如果你的系統地區本來就是日文,直接解壓縮也行;如果不是,就走安裝器確保解對。

對台灣使用者的意義很直接:中文 Windows 不必改系統地區設定、不必再找轉區工具,就能打開日文音色庫與專案。順著相容這條線,VOCALOID 3/4 的 .vsqx、一般 .mid、.musicxml 也都在可匯入的清單上。不過 README 把界線講明白,它對 UTAU 只做選擇性的向下相容,把目標放在用更少的步驟解決問題。

下載完沒有聲音,是設計而不是疏漏

很多人裝完第一個反應是:怎麼沒有示範歌手?官方常見問題給了明確答案:OpenUtau 不提供預設音色庫,也沒有吉祥物,而且寫明沒有計畫要做。這是刻意的設計切割。

商業歌聲合成產品通常把引擎和聲音綁在一起賣,你買的是一整套。OpenUtau 免費給你引擎,聲音則是社群的資產:UTAU 時代的音色庫資料夾(character.txt 加 oto.ini 那套規格)放進歌手資料夾就能用,DiffSinger 這類神經網路音色庫也吃。音色庫裝好後統一在工具選單的歌手管理頁面檢視,有問題可以按一鍵產生錯誤報告,它會逐檔檢查 oto.ini 指到的聲音檔存不存在、設定合不合理,把結果寫成文字檔給你看,疑難排解不用瞎猜。要注意的是,編輯器本身 MIT 授權可以商用改作,歌聲的授權卻各自掛在每個音色庫身上,商用前得看該庫自己的條款。

重採樣器的相容性也是同一種態度。內建的 WORLDLINE-R 在所有平台都能跑,外部 exe 重採樣器(moresampler、TIPS 之類)大多可用,macOS 與 Linux 上靠 Wine 幫忙執行,偏好設定裡就留了 Wine 路徑欄位。官方說法一樣誠實:打算維持相容,但不保證。

調音從一串代碼,變成看得見的曲線

UTAU 時代的調聲靠 flags,在欄位裡填一串字母代碼調整音色。OpenUtau 用表達式系統取代 flags,內建的 WORLDLINE-R 重採樣器支援直接在曲線上拉參數,官方 README 的說法是接近多數歌聲合成編輯器的調音體驗。鋼琴捲軸裡,音符帶著歌詞與音素、下方展開力度與音高參數軌,配音高曲線與參考波形:

OpenUtau 鋼琴捲軸介面,音符帶日文歌詞與音素標記,下方是力度與音高參數軌Pin
OpenUtau 的鋼琴捲軸畫面(圖片來源:OpenUtau 官方 README 示範動圖)

顫音有自己的編輯器,滑鼠拉出起伏形狀,不必記任何代碼:

OpenUtau 顫音編輯畫面,以曲線方式調整顫音的起伏形狀Pin
顫音編輯器用拉的調整起伏(圖片來源:OpenUtau 官方 README 示範動圖)

歌詞怎麼變音素,交給音素器處理。VCV、CVVC、Arpasing 等體系都有對應實作,日文、英文、中文、韓文、俄文等語言各有音素器,原始碼內建的音素器定義檔超過 50 個。它在編輯時即時運算,結果直接顯示在音符下方的信封區,以往要靠外掛工具預先轉換的流程,現在是編輯器的一部分。傳統連續音做法是自己在音色庫裡手挑別名填進音符,音素器等於把這套工換成自動的,而且改歌詞立刻重算。日文庫找不到別名時,內建的平假名與羅馬拼音轉換器可以先把歌詞換成音色庫認得的寫法。目前一條音軌只能掛一種音素器,官方常見問題把軌內切換列為未來版本會支援的功能,在那之前想換語言就開新軌。播放體驗上,預渲染會在你編輯時先把聲音算好,按播放不必等重新合成。專案檔每 30 秒自動備份,程式崩潰後下次啟動會跳還原對話框,這些都是長時間做歌才會在意的事。

AI 歌聲也在你機器上跑

這個專案對神經網路歌聲的態度值得單獨看。相依清單裡直接內建 Microsoft.ML.OnnxRuntime,CPU、GPU、DirectML 三種版本都列著:DiffSinger 類的神經網路歌聲合成、ENUNU 歌手、RMVPE 抓音高、GAME 從錄音轉 MIDI,推理都在本機完成。需要補裝的模型與工具,從工具選單的依賴安裝抓,來源是 OpenUtau 官方放在 GitHub Pages 上的軟體註冊表,整份清單目前 27 項,其中 5 項可以一鍵安裝,包括英文字典、GAME、DiffSinger 聲碼器與 RMVPE。

往源頭看,這些模型也能串成自製音色庫的前處理線:錄好一段清唱,GAME 或 SOME 把錄音轉成 MIDI 當骨架(切分音訊與重取樣在轉錄管線裡自動處理),再交給抓音高模型標記起伏,骨架與標記都能拿去對樣本。擴充介面也開放得完整,編輯巨集與音素器各有 API 文件,社群可以自己寫音素器補上官方沒支援的語言。

網路行為方面,整包原始碼裡找不到任何分析或遙測元件。更新檢查在啟動時會背景安靜地查一次,選單裡也能手動查,兩者都只連 GitHub。程式崩潰時把專案存在本機讓你救回,不上傳任何東西。與 VOICEVOX 引擎的整合也是打本機 127.0.0.1:50021,要你自己先把引擎跑起來。對在意作品內容不出機器的人,這套邊界相當乾淨。

一個實際提醒:官網下載頁特別註記,要用 DiffSinger 或 macOS arm64 版本的人,抓 beta 通道的建置,穩定版不一定跟得上這些功能。

安裝前該知道的幾個門檻

規模先看數字。最多人使用的 beta 0.1.568,安裝包從 3 月發布到現在累積 31,337 次下載;beta 通道的更新檢查量是另一種訊號,光 Windows x64 兩條檢查頻道就累積超過 34.6 萬次,每次檢查會抓一次更新清單,數字不等於人數,但看得出有一群持續開著軟體的人。macOS arm64 的安裝包半年 2,351 次,蘋果晶片使用者明顯是少數族群。

各平台的門檻不同。Windows 這邊,缺 VC++ runtime 會跳 worldline.dll 載入錯誤,裝一下微軟官方的配發套件就解;beta 0.1.569 起需要 .NET 10 Desktop Runtime,前一個 beta 0.1.568 對應的是 .NET 8,所以它不是雙擊就能跑的綠色軟體,執行環境要自己補。下載包有得選:Windows 分安裝版與免安裝 zip,macOS 是 dmg 映像檔,Linux 以 tar.gz 為主、beta 通道另有 AppImage,更新交給內建更新器抓你所在通道的清單,下載完自動重啟換新。macOS 這邊,開發團隊沒買 Apple 開發者簽章,第一次打開會看到應用程式已損毀的提示,官方解法是在終端機跑一行 xattr -rc 解除隔離屬性,常見問題裡也寫明了理由:給 Apple 簽章要花錢,對這個專案沒有必要。

我在 macOS 26.6 的 Apple Silicon 機器上實際啟動過兩個版本:0.1.568 與 0.1.569 的視窗都沒能開起來,卡在介面框架的渲染計時器初始化失敗,但程式確實建立了資料夾與設定檔,GitHub 議題區也查不到相同回報。這是單一環境的觀察,不能推論一般使用者的經驗,Windows 仍是這個專案的主戰場;Intel Mac 另有開白窗的已知問題,官方文件記載把視窗調整大小後就會正常顯示。

適合誰,下一步往哪走

想免費做虛擬歌手翻唱或原創、手上已經有 UTAU 音色庫資產、在意作品內容留在本機的人,OpenUtau 值得投時間。反過來說,期待裝完就有聲音可用、或期待商業軟體那種從編曲到混音一條龍的人要先想清楚:README 的不做清單寫得很直白,它只做最低限度的混音,成品輸出後的後製是你的數位音訊工作站的事。

入門的順序大概是:先去找音色庫,再照著教學走。介面不用擔心語言,安裝後會抓系統語言,繁體中文在內建的 22 種翻譯裡,由 Crowdin 翻譯計畫維護。GitHub wiki 有中文教程匯總頁,社群維護的 OpenSynth 百科也有中文使用說明。做翻唱的話,拆伴奏可以搭配 有道 Clear 這類人聲分離工具,找歌詞有歌詞易 GeciYi;如果你要的其實是把稿子唸出來,EasyVoice 那類文字轉語音工具更對口。

常見問題

免費嗎?可以商用嗎?

編輯器本身是 MIT 授權,免費、可商用、可改作。但歌聲的權利不在編輯器身上,每個音色庫有自己的授權條款,商業使用前要看該音色庫的規定。

跟 VOCALOID 差在哪?

商業產品把引擎和聲音綁在一起賣,OpenUtau 免費給引擎、聲音由社群供給。.vsqx 專案可以匯入,README 也明講它不追求 VOCALOID 相容,只做有限的功能往來。

版本號 12 年都停在 0.1,是不穩定嗎?

版號反映這個專案的自我定位,與穩定度沒有直接關係。穩定、beta、alpha 三條通道並行,穩定版一年多才一級,最新的開發都落在 beta 與 alpha 線上,alpha 這個月一週數版,更新檢查會依你選的通道過濾版本。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1355

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...