開源 Live2D 數位人工具,把 Dify 聊天機器人換上會說話的臉

把 Dify 聊天機器人換成會開口說話的 Live2D 角色,官方推薦的體驗路徑是一條 docker compose;但開源授權只蓋到殼,Live2D 有商用門檻,分享功能留在雲端版,預設值整組簡中,動手自架前該看的四道邊界一次看清。

用 AI 摘要這篇文章:

把一個自己組好的 Dify 聊天機器人,變成畫面上會開口說話的動漫角色,要花多少工?用 AWESOME-DIGITAL-HUMAN 這個開源專案,官方推薦的體驗路徑是一條 docker compose 指令。瀏覽器裡站著一個 Live2D 角色(VTuber 常用的那種 2D 模型技術),你對麥克風說話,語音轉成文字,送進你在 Dify 上組好的應用,回覆再變成語音播出,角色的嘴型跟著節奏開合。專案 2024 年 5 月出現在 GitHub(帳號 wan-h 下的 awesome-digital-human-live2d 儲存庫),MIT 授權,累積超過 2,400 顆星(截至 2026 年 10 月)。

不過「開源」兩個字在這個專案上只蓋到一層殼。角色會動,靠的是內嵌在程式裡的 Live2D 技術,那一層有自己的授權規則,年營收達到一定規模的商業使用者要另外向 Live2D 取得授權;把數位人分享給別人用的功能,留在官方雲端版 light4ai.com 上,開源版沒有;開箱的預設值,從語音音色、語音辨識模型到介面文字,整組是簡體中文世界的設定。這些邊界都寫在專案倉庫與官方文件裡,下面逐項攤開來看。

它做的是哪一種數位人,先分清楚

先把它在做的事情講精確。這是一套 Live2D 前端加後端的組合:前端是瀏覽器裡的可互動角色,能換角色、換背景、做表情與動作;後端串三段服務,語音辨識(ASR,把聲音變文字)、代理人(Agent,把文字交給你的 AI 應用想答案)、語音合成(TTS,把答案變聲音)。你說一句話,聲音變文字,文字進 Agent,答案變語音,角色開口回答,中間每一段的引擎都能在設定檔裡換。官方還分了兩種互動模式:對話模式以文字為主,沉浸模式走整段語音互動。

AWESOME-DIGITAL-HUMAN 官方架構圖,瀏覽器前端經 adh 伺服器連到 Dify、FastGPT、Coze 等編排框架與模型層Pin
官方架構圖:adh 服務層對上接瀏覽器,對下接 Dify、FastGPT、Coze 等平台與雲端或本地模型。

Agent 這一段官方支援四種接法:DifyAgent、FastgptAgent、CozeAgent,以及一個相容 OpenAI 介面的選項,Dify、FastGPT、Coze 三個編排平台都算主力目標。以 Dify 為例,設定裡填三個欄位就接上:API 伺服器位址、API 金鑰、使用者名稱。要注意的是出廠預設的 Agent 叫 repeaterAgent,顧名思義,它只會把你的話原封不動唸回來,是拿來確認整條管線通不通的假人,正式使用前記得在設定裡換成真的。

官方釋出的展示影片裡,整套介面走深色主題:角色站在畫面中央,下方一條輸入列,左邊麥克風、右邊送出,旁邊再掛角色與背景的選單,背景從賽博龐克霓虹小巷、色彩繽紛的動漫城市到寫滿公式的黑板都有。整個畫面看起來像一個乾淨的網頁版對話室,角色即時跟著語音做表情,沒有安裝任何外掛程式的痕跡,這也是純瀏覽器方案最大的賣點:訪客打開網頁就能聊,不必先裝 App。

AWESOME-DIGITAL-HUMAN 官方展示影片截圖,深色介面中央站著 Live2D 角色,底部是麥克風與文字輸入列Pin
官方展示的深色介面:Live2D 角色站中央,底部輸入列左邊麥克風、右邊送出。

也要先分清楚它做的是哪一種數位人。它不做真人影片生成,不會輸出一支有數位人主角的影片檔,角色是瀏覽器裡即時互動的 2D 模型。想要「輸入文字、生成數位人播報影片」的人,該看的是 AIGCPanel 這類開源數位人系統;想把自己聊天紀錄微調成 AI 分身的,方向在 WeClone 這類數位分身工具。AWESOME-DIGITAL-HUMAN 的位置很明確:給你已經存在的 AI 應用,換上一張會說話的臉。

2 核 2G 的輕量宣稱,和部署指南各說各話

README 的賣點寫得吸引人:超輕量級,配置要求低於 2 核 2G。但同一個倉庫裡的官方部署指南,系統需求那欄寫的是 CPU 2 核起跳、記憶體 4GB 起跳。同一個專案的兩份官方文件,對「一台 2G 記憶體的小機器跑不跑得動」給了相反答案。這種 README 與部署指南打架的情況,通常代表輕量案例存在過(例如只跑文字對話),但完整功能形態早就超過那個數字。

記憶體會被誰吃掉,看部署形態就知道。快速啟動是一份 compose 檔案,一次拉起 4 個容器:nginx 負責對外(連接埠 8880)、網頁前端、API 後端,以及一個跑在 CPU 上的 FunASR 語音辨識服務。也就是說,只要你開語音輸入,那顆帶著辨識模型的容器就住在你的機器裡,自己吃資源。鏡像全部放在阿里雲杭州的公開鏡像倉庫,第一次下載 4 個容器的映像檔需要一點時間與磁碟空間。用原始碼裸機部署的話是另一組連接埠:前端 3000、後端 8000,後端還附一份 API 文件頁方便除錯。

務實的讀法是這樣:只玩文字對話、不開語音辨識,負擔確實小;要完整語音形態,照部署指南的 4GB 準備,別拿 README 的 2G 去賭。租雲主機時把部署指南當準,README 那句話當行銷文案看。容器都設了自動重啟,機器重開後服務會自己爬起來,這點對放在雲主機上長跑的小服務算是貼心。

部署完成後打開瀏覽器,容器形態連 http://localhost:8880 就能看到角色;想讓別台機器連,防火牆記得開 nginx 映射出來的那個連接埠。這些細節官方指南都寫了,真正容易卡住的地方反而在下一節要講的瀏覽器與網路限制。

MIT 標籤只蓋到殼,角色會動的那層另外有規則

倉庫根目錄的授權是 MIT,這部分沒有疑問,專案自己的程式碼可以自由使用、修改、再散布。但前端資料夾裡躺著兩份另外的授權檔。網頁裡讓角色動起來的核心(Cubism Core),授權屬於 Live2D 專有軟體授權,不在開源範圍;框架層(Cubism Web Framework)的授權檔裡還寫著一條明確的商業門檻:年營收達到 1,000 萬日圓以上的公司行號,使用這套 SDK 必須先向 Live2D 取得發行授權。1,000 萬日圓換算新台幣大約兩百萬出頭,依匯率浮動。

倉庫還直接打包了 12 個現成的免費角色。Haru、Hiyori、Shizuku、Rice、Tsumiki 這些名稱,與 Live2D 官方長年發布的範例模型高度重疊,合理推測多數就來自官方樣本,而這些角色的資料夾裡沒有各自附授權檔。個人在家玩、公司內部試驗,通常碰不到紅線;要把角色做成對外的商業門面,角色素材的授權就得逐個查清楚,這層責任 MIT 不會替你扛。

整理成一句話:專案程式碼走 MIT,Live2D 技術層走 Live2D 自己的條款,角色素材再依個別模型的條款。三層各自獨立,商用前把三層都看過一遍。

裝完的第一件事,是把整組簡中預設值換掉

這個專案的中國出身,滲在每個預設值裡。語音合成預設走 EdgeTTS(微軟的免費語音介面,同家族的自架作法可參考開源 Azure TTS 自架服務),不花錢,但預設音色是 zh-CN-XiaoxiaoNeural,一口簡中普通話;語音辨識的 FunASR 預設模型,是簡中普通話的辨識模型;介面翻譯檔只有英文與簡中兩份,沒有繁中。角色開口是對岸口音、字幕是簡體字、選單也寫著簡體字,台灣使用者裝完的第一件事就是把這幾處換掉。

AWESOME-DIGITAL-HUMAN 背景選單截圖,角色與背景分頁下排列賽博龐克、動漫城市等背景卡片,介面文字為簡體中文Pin
背景選單一覽,介面文字是簡體中文:這是台灣使用者裝完後最先注意到的隔閡。

好消息是換得掉。微軟語音的音色清單裡本來就有 zh-TW 開頭的台灣音色,在設定裡選了就換;語音辨識也能改接其他引擎,設定檔裡 ASR 的支援清單本來就列了多個選項。壞消息是介面沒有繁中語言檔,要嘛看得懂簡中,要嘛自己補一份翻譯檔,介面用的是常見的 i18n 架構,加一個語言檔的難度不算高。

另外幾個「裝完不能動」的經典坑,官方常見問答都記了,先知道可以少踩雷。麥克風在 http 連線下會被瀏覽器擋下來,官方解法是要你在 Chrome 的實驗設定裡,把部署位址手動加進安全清單(正式做法是上 https,自架小機器常常沒有憑證)。Dify 裝在同一台機器的 localhost 時,容器裡的服務連不到,位址要填那台機器的實體 IP。Windows 上跑 Docker 會碰到 host 網路模式不支援的問題,要把 compose 檔裡的網路設定註解掉、改開連接埠。還有一個看起來嚇人的畫面:頁面跳出「Soul is Death!」,意思就字面上那樣直白,後端斷線了。前後端每秒一次心跳,心跳丟了就顯示這行字,回頭檢查後端服務就能解。

討論區裡還留著幾則沒人處理的介面瑕疵:有人遇到設定按鈕點了不彈出設定頁,反而切進語音對話;有人反映設定介面裡的連接埠改了也不生效,照官方文件回頭改 compose 與 .env 才是正規解法,但回報者試了說連 .env 都沒作用。單看每一則都不算大事,但疊在一起說明一件事:這套介面的成熟度還在社群打磨階段,遇到怪狀況先去翻討論區,多半已經有人踩過。

想分享給別人用?那個功能在雲端版

開源版跑起來之後,角色住在你的機器上,自己用很順。但如果你想把它當成一個到處分享的東西,例如產生連結傳給客戶,或把整個數位人嵌進官網讓訪客直接聊,這條路在開源版上是斷的。討論區裡有人直接問「開源版是不是不支援發布」,這則議題到今天掛著零回覆。

分享能力被放在官方的雲端版上,網址 light4ai.com,中文名沐光而行,目前公測中。官網列出的雲端版額外功能:個人應用管理、內建服務接入、應用分享(連結分享與網頁嵌入)。換句話說,開源版拿到的是引擎,雲端版補上把引擎變成服務的那圈東西。雲端版頁尾掛的是中國四川的 ICP 備案,營運主體與資料落地都在對岸,接進對外服務前,這一點先放進考量。官網上也掛了一個用這套專案做的智能客服範例,可以直接點進去體驗成品長什麼樣子,再決定要不要自己架。

項目開源自架版light4ai.com 雲端版
部署位置自己的伺服器官方雲端(中國四川備案)
對接 AI 應用Dify、FastGPT、Coze、OpenAI 相容 API 都能接內建服務接入為主
現成角色打包 12 個免費角色官網生態另有人物客製
分享與嵌入沒有連結分享、網頁嵌入
費用免費,自擔機器與維護公測階段免費,之後收費方式未公布
截至 2026 年 10 月,依官方倉庫與官網公開內容整理。

補一個實際的觀察:這個專案的教學資源全部長在對岸平台上。README 列的部署與開發說明、常見問答在倉庫裡找得到,但更完整的影片教學放在 B 站,作者的長文教學放在知乎與微信公眾號,語言與平台都是簡中世界。看得懂簡中的人等於多一整排現成教材;只讀繁中的人,要有心理準備,遇到問題多半得靠翻官方文件與討論區原文自己解。

維護是社群業餘節奏,現在適合誰跳下去

看維護紀錄,這是典型的業餘社群專案。2024 年 5 月開倉,同年 8 月約 500 顆星,現在超過 2,400 顆,兩年成長四倍多;程式碼的密集更新期在 2025 年年中(加入 Coze 支援、修 Dify 語音錯誤),2026 年只剩兩次觸碰(4 月更新 README、5 月修一個 web 容器的錯誤),main 分支沒有發布過正式的 GitHub Release,版本標籤停在 v2.0.0,設定檔裡的版本號已經寫到 v3.0.0,README 的教學影片也還停在 v2.0.0。討論區十來則開著的議題,多數掛著零到一則回覆,其中包括一則指出映像檔內 nginx 版本有已知漏洞的安全議題,同樣沒有人接。

所以適合誰?已經有一個能動的 Dify 或 FastGPT 應用、想給它加一張會說話的臉、而且有辦法自己顧機器的技術玩家,現在就可以抓下來玩,這正是它最好的使用場景。反過來,想直接拿它當對外營運產品的人,要先過兩關:Live2D 那層的商用授權門檻,以及安全更新自己扛的現實。最省力的試水方式,是先開 light4ai.com 的公測版感受完整流程,確定這個形態是自己要的,再回頭自架。

一句話收尾:它把「給機器人一張臉」這件事做得相當完整,代價是授權、語音預設值與長期維護都要自己來。倉庫與部署指南都公開在 GitHub 上,動手前把上面這些邊界記下來,能少走很多彎路。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1771

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...