MNN TaoAvatar 是什麼?手機離線跑的阿里開源 3D 數位人

MNN TaoAvatar 是阿里巴巴開源、五個模型全部在手機離線跑的 3D 數位人 app,斷網也能語音對話。拆開官方安裝包與原始碼後看清台灣使用邊界:繁中介面只在原始碼裡、zh-TW 系統語言會載到英文語音模型、Android 16 官方包載不動,模型下載量實測約 1.9GB。

用 AI 摘要這篇文章:

阿里巴巴的 MNN 團隊把自家論文做成了一支 Android app:MNN TaoAvatar。它把五種 AI 模型全部塞進手機離線跑,你對麥克風說話、它轉成文字、生成回答、合成聲音、驅動表情,再把整個 3D 人物即時算出來,全程不經過任何雲端。開飛航模式,它照樣陪你聊天。這是 2026 年想在手機上玩多模態 AI 最完整的一份開源示範。

不過要先講結論:它現在是一個「原始碼跑得比官方安裝包快四個月」的半成品。台灣讀者直接下載官方 APK 會撞三道牆。安裝包裡沒有繁中介面,繁中字串只寫進了原始碼;系統語言設繁體中文時,它載入的是英文的語音模型,等於聽不懂也說不出國語;而且在 Android 16 的手機上,官方安裝包會因為系統庫的對齊問題直接載不動。有旗艦手機、願意自己編譯最新原始碼的技術玩家,現在就能玩;想裝來長期使用的人,建議先看懂下面這些邊界再決定。

五個模型全部塞進手機,斷網也能跟它聊天

這支 app 的正式名稱是 MNN-TaoAvatar,是阿里巴巴研究團隊把 2025 年 3 月發表的 TaoAvatar 論文做成的落地展示。整條對話管線由五個模型接力:串流語音辨識模型(sherpa)把你的話邊講邊轉成文字;Qwen2.5-1.5B 語言模型生成回覆;語音合成模型(中文走 bert-vits2,英文走 supertonic)把回覆變成聲音;UniTalker 把聲音訊號轉成臉部表情與身體動作參數,再用 blend shapes 補上細節;這些參數餵進 TaoAvatar 的神經渲染模型,即時算出整個 3D 人物畫面。這些零組件大多是現成的開源模型,阿里做的價值在整合:把五個模型擠進一支手機的記憶體,還能同時跑。

MNN TaoAvatar 的多模型管線架構圖,從語音辨識、語言模型、語音合成、表情驅動到神經渲染的官方流程圖Pin
MNN TaoAvatar 官方管線圖:五個模型如何接力完成一次語音對話(圖片來源:alibaba/MNN repository)

對話品質要先有正確期待。Qwen2.5-1.5B 是 15 億參數級的小模型,選它著眼的是塞進手機,要它跟雲端旗艦模型比學識本來就強人所難。問天氣、閒聊、短問答可以,要它寫長文或推理多步驟問題,能力邊界很快會撞到。這是整類離線方案的共同交易:用模型等級換隱私與斷網能力,TaoAvatar 把這筆交易攤在手機上讓你自己驗。

渲染這一層是論文的主秀。TaoAvatar 用 3D 高斯潑濺(3D Gaussian Splatting)建構全身人物,訓練時先讓一個又大又重的 StyleUnet 網路處理身體隨姿勢變形的細節,再把這些變形知識「烘焙」進一個輕量的小網路,好讓手機跑得動。論文宣稱在 Apple Vision Pro 這類高解析裝置上能到每秒 90 幅畫面;要留意這是作者在論文裡的數字,量測對象是頭戴裝置,你的 Android 手機不在那份清單上,手機上的實際流暢度官方沒有給保證。

還有一件事要先把期待講對:這個數位人是「一位固定的人」,不是生成你自己的分身。她的名字叫小淘,從程式套件的命名(com.taobao.meta.avatar)看,是淘寶側團隊打造的角色。GitHub 上有人問能不能換成自己的臉重建一個,維護者在 2025 年 11 月回覆得很直白:目前不支援。同一時間也有人問訓練方法,維護者給了論文團隊的專案頁連結,並附上一句但書:訓練端的程式碼沒有開源。也就是說,開源的是「跑」的這一半,想做出自己的 TaoAvatar 人物,拿不到完整的訓練工具鏈,拿它做自己的虛擬主播或個人化角色,此路暫時不通。

官方安裝包只有 27MB,剩下的將近 2GB 第一次啟動才下載

安裝有兩條路。輕鬆的那條:README 的版本發布區直接放了 APK 下載點,目前有 v0.0.1 與 v0.0.2 兩個官方包,放在阿里的 CDN 上。我把 v0.0.2 抓下來量,只有 27.4MB,這麼小是因為模型全都不在包裡。第一次打開 app,它會從 ModelScope(阿里經營的模型託管站)把模型庫一個個抓下來:語言模型 839MB、表情動作模型 369MB、渲染模型 138MB、中文語音辨識 282MB、英文語音辨識再加 282MB,全部加總約 1.9GB。官方建議預留 5GB 儲存空間,是相當保守的說法,實際需要的模型檔案不到 2GB。

從台灣的網路直接連 ModelScope 是通的,我查詢它的模型清單 API 都正常回應,第一次下載不需要另外準備什麼。下載速度的體感會因每個人的網路環境而異。下載過程在 app 內是一個聚合進度畫面,從原始碼看,它把七個模型庫的下載量加總成一條總進度與即時速度顯示,已經抓完的模型會自動跳過,重開 app 不必從零開始。

版本線索值得攤開看。v0.0.1 是第一次公開發布,當時就標明「可以在 app 裡用語音辨識與合成跟 3D 角色對話」;v0.0.2 對應 2025 年 12 月加入的 supertonic 英文語音支援,這也是目前 README 上的最新安裝包。從那之後大半年,官方沒有再發第三個包,期間原始碼陸續修了編譯問題、重構了整個下載模組、加上繁中介面,這些進展全都沒有反映到官方安裝包。判斷一支開源 app 的成熟度,「倉庫最後提交」與「官方包最後發布」要分開看,這裡兩個日期差了將近四個月。

另一條路是自己編譯:把 alibaba/MNN 這個 repository 複製下來,走進 apps/Android/MnnTaoAvatar 目錄,用 Android Studio 按 Run,或者執行 ./gradlew installDebug 部署到手機。麻煩,但有回報:繁中介面、後續的修正與新功能都只存在於原始碼裡,官方安裝包不會替你更新。順帶一提,網路上流傳的舊教學若寫著 apps/Android/Mnn3dAvatar 這個路徑,那是 2025 年 6 月改名前的舊目錄,現在裡面只剩兩份說明檔,程式碼已經搬到 MnnTaoAvatar 了。

台灣手機會拿到英文的耳朵和嘴巴

這是整個專案對台灣讀者最關鍵、也最少被講清楚的一件事。翻它的原始碼會看到,語音模型的選擇寫死了一個判斷式:系統語言是簡體中文(zh-CN)才載入中文雙語辨識模型與中文語音合成;其他所有語言設定,一律載英文版辨識與英文語音。換句話說,手機語言設成「繁體中文(台灣)」時,這個 app 把你當成英文用戶。它聽不懂你對麥克風說的國語,回答也不會用中文聲音講出來。

介面語言的狀況更諷刺。2026 年 4 月,官方合併了完整的繁中介面字串進原始碼,連「與小淘對話」「聆聽中」這些字串都有繁中版,看得出有人真的照顧了台灣與香港用戶。但官方安裝包停留在 2025 年 12 月的 v0.0.2,我把包拆開、翻遍裡面的資源表,繁中字串一個都不存在。

GitHub 上 alibaba/MNN repository 的 MnnTaoAvatar 目錄頁面,檔案清單包含 README_TW.md,最新 commit 是 2026 年 4 月的繁中介面支援Pin
MnnTaoAvatar 目錄在 GitHub 上的現況:README_TW.md 與繁中支援 commit 都在原始碼裡(圖片來源:GitHub alibaba/MNN)

所以台灣用戶面前的選項是這樣的:裝官方包,得到英文介面加英文語音;把系統語言切成簡體中文,得到中文語音,代價是整支手機的介面跟著變;想要繁中介面配中文語音,只剩自己編譯最新原始碼加上切系統語言這一條路,或者等官方把新版本裝包發出來。這段結論來自原始碼與安裝包的靜態拆解,我沒有實際在手機上切換語言跑過;不過判斷式就明明白白寫在程式裡,語言分岔是設計使然。

想現在裝的人,先確認手機版本與自己的期待

Android 16 是第一個要先確認的關卡。2026 年 2 月有人在 GitHub 回報,官方安裝包在 Android 16 上載入失敗,原因是包裡的六個原生系統庫沒有做 16KB 記憶體頁對齊,新版系統直接拒絕載入。官方隔了一個月給出解法:用新版 NDK 重新編譯,加上一行鏈結器參數。修法給了,官方安裝包卻沒有跟著更新,README 上最新的包仍然是 2025 年 12 月那一版。也就是說,2025 年下半年之後出廠、預載 Android 16 的旗艦手機,直接裝官方包大概率先撞牆,想跑就得走自行編譯那條路。

再來是硬體門檻,這是官方自己開的規格:Snapdragon 8 Gen 3 或 Dimensity 9200 同級以上的旗艦晶片、8GB 以上記憶體、ARM64 架構。對照台灣市面上常見的中階機,這個門檻會刷掉一大半,官方也明講低於規格的裝置會卡頓、聲音斷續。五個模型同時在手上跑,吃的就是晶片與記憶體,這個門檻不是行銷話術。

專案狀態決定你要不要依賴它。MNN 推理引擎本身是個大而且活躍的專案,一萬六千多顆星、Apache-2.0 授權,到 2026 年 9 月都還有推進。但這支 app 所在的子目錄,最後一次更新停在 2026 年 4 月的繁中支援;iOS 版更妙,README 從 2025 年 6 月就寫著「稍後推出」,一年多過去,同一句話還掛在那裡。把它當研究展示來玩很合適,當成長期產品每天用,版本風險要自己扛。

問題追蹤區的溫度也反映了這個定位。2025 年 11 月有人留言問「這個專案還有進展嗎」,語氣已經在催;同一時間另有人問能不能把部分模型換成雲端 API、省下手機算力,討論串裡的答案是模組在架構上可以替換,但要自己動主程式的碼;官方版本沒有提供任何切換選項,全離線看來就是它的設計立場。社群真正密集回報的,反而是崩潰與相容性問題:Vulkan 驅動、Android 16 對齊、特定機型閃退。一支吃滿旗艦硬體的展示型 app,相容性長尾本來就難照顧,這點先有心理準備。

隱私邊界乾淨,第一次開機要過中國的模型站

隱私這條軸,它在原始碼層是真的乾淨。安裝包要求的權限只有四個:網路、麥克風、防止休眠、診斷資訊讀取,相機、定位、通訊錄一概沒碰。把包裡的字串全部掃過,會對外連線的網址只有三組:ModelScope 的模型下載 API、華為 Modelers 的備援下載端點,以及 GitHub 連結。推論過程中沒有任何雲端 API 端點,你的聲音與對話內容離開手機的機會,只有第一次下載模型那一次,之後開飛航模式照用不誤。

這是它與市面上雲端數位人服務的根本差異。後者的語音樣本、對話紀錄都進服務商的伺服器,這支 app 的整套管線都在本機。對隱私特別在意、又想摸摸看對話式 3D 數位人的讀者,這個邊界值得知道;至於模特兒固定、語言分岔這些限制,前面已經講過,兩件事一起衡量再決定。

現在適合誰、不適合誰

適合出手的人:手上有 2024 年之後的旗艦、系統還在 Android 15 或更早、會用 Android Studio 編譯,而且想親眼看看 3D 高斯潑濺加蒸餾後的小模型在手機上跑起來什麼樣子。這是少數把整條多模態管線離線搬到行動裝置的開源實作,研究價值大於日用價值。同樣對「手機上跑本地 AI」有興趣的話,先前介紹過的 Operit 開源安卓 AI 助手 走的是實用取向,把本地推論與手機自動化縫在一起,日常任務的可用性高得多。

不適合現在進場的人:要繁中介面開箱即用、想用自己的臉做分身、等 iOS 版,這三個願望目前都沒有時間表。如果你的目標是做生成式人物的影片內容而非即時互動,桌面端的工具成熟得多,先前評過的 FaceFusion 開源換臉後製平台 就是那一側的代表,代價是要看懂它的授權分層與內容規範。單純想把 Android 畫面投到電腦上展示或錄影,Escrcpy 開源投屏工具 是順手的老朋友。

一句話收尾:MNN TaoAvatar 證明了「全離線的手機數位人」在 2026 年做得到,也順便示範了從論文到產品之間那段路有多長。想玩技術的人現在就值得編一份來看,其他人把它放進觀察清單,等官方安裝包把繁中與新版系統的帳補上再說。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1185

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...