FaceFusion 開源換臉平台,把影片對嘴與換臉留在自己顯卡上

FaceFusion 是 GitHub 上近 3 萬顆星的開源換臉後製平台,換臉、對嘴、臉部修復都能在自己電腦完成,素材不上傳雲端。安裝前值得先看清三件事:內容檢查寫死在程式裡沒有開關、預設換臉與對嘴模型採非商業授權、換臉核心原生只有 128 像素,想接案商用得先讀官方那張模型授權表。

用 AI 摘要這篇文章:

剪了一支片子,導演說演員的臉要換掉重拍成本太高;配好音的影片,嘴型就是對不上畫面。這類後製需求丟給雲端換臉服務,價目表按秒計費,素材還得整批上傳到別人伺服器。於是很多人在 GitHub 上找到 FaceFusion,近三萬顆星的開源專案,下載下來跑在自己電腦上,素材不出門,看起來就是那個「免費方案」。這個判斷對了一半:工具本身貨真價實,跑得起來也確實全部在本機運算;但它的免費只兌現到程式碼那一層,真正決定你能拿它做什麼的,是模型授權清單,還有一道拿不掉的內容閘門。這篇把這兩件事攤開講清楚。

素材不出門的後製平台,做的不是即時特效

先把定位講對,很多人會把 FaceFusion 和即時換臉工具搞混。它是 2023 年 8 月出現在 GitHub 上的後製平台,官方自述是「產業領先的臉部操作平台」,到 2026 年 9 月初累積約 29,800 顆星、4,850 多個 fork。它的戰場是一張照片或一支已經拍好的影片:把來源臉換到目標臉上、讓嘴型對上配音音檔、把模糊的臉修清晰、調整年齡、還原表情、移除背景、幫黑白影像上色。這些能力拆成十一個處理器(processor),在命令列裡像積木一樣串接,預設啟動的就是換臉。

TechMoon 內文圖|FaceFusion GitHub 倉庫頁Pin
FaceFusion 的 GitHub 倉庫頁:29.8k 星、最新版 3.9.0,About 側欄的授權欄位連結到非標準授權(2026 年 9 月)

真正讓它像「平台」而非單次腳本的,是工作管理系統。你可以把一批任務建檔、排進佇列、批次執行,失敗的任務可以重試,全部流程都能用 headless 模式跑,也就是不開圖形介面、直接進排程器。這套設計瞄準的是後製工作流:晚上丟一批素材進去,早上收成片。介面用 Gradio 搭起來,瀏覽器裡操作,語言檔只有英文一種,中文使用者得自己對照文件找對應的名詞。

它確實也有一個 webcam 版面,文件裡叫 Deepfake Webcam,開起來可以把鏡頭畫面即時換臉,還能透過 UDP 串流通到 OBS 去直播。但讀完文件你會明白那是附屬功能:整個專案的重心、模型清單的深度、工作管理系統的設計,全部壓在離線後製這條線上。要即時直播換臉,後面會講到另一個更對口的工具。

它會直接拒絕你的素材:寫在程式裡的內容閘門

這是整篇最值得你知道的一段。FaceFusion 官方免責頁寫明:這套軟體被設計成會拒絕處理裸露、血腥與敏感內容,使用者若從事相關活動會被社群封禁,違法者通報主管機關。多數工具的這類聲明只是文案,FaceFusion 是真的寫進了程式碼,而且拿不掉。

我把 master 分支的原始碼抓下來逐檔讀過。內容檢查由三個獨立的偵測模型組成,分別來自 EraX、Marqo、Freepik 三家,評分門檻各不相同;一個影格要被判定為不宜內容,需要三個模型裡至少兩個投同意票,這種集成投票的設計是為了壓低單一模型誤判的機率。影片處理時它不會逐格掃描,而是每秒抽一個影格取樣,取樣命中的比例超過一成,整個工作直接中止,回傳錯誤代碼 3。圖片就是單張判定,一次定生死。webcam 模式更直接,鏡頭畫面被判定不宜的那一刻,程式把相機釋放掉,畫面就斷了。

關鍵在於:這套檢查沒有關閉選項。命令列參數表裡找不到任何 content checker 或 NSFW 開關,圖形介面的設定裡也沒有,它就是管線的一部分。官方 FAQ 甚至把「分析跑到 100% 之後程式就停了」列成一條正式問答,答案直白:我們基於倫理考量不允許 NSFW 內容。換句話說,如果你丟進去的素材被擋下來,那不是安裝壞掉,是設計如此。這個選擇值得對照著看:站內介紹過的 Deep-Live-Cam,就把同類檢查做成預設關閉的選項,要不要開由使用者自己決定;FaceFusion 走了完全相反的方向,把安全決策從使用者手上收走。你可以在價值上不同意這種家長式設計,但對創作者來說它至少意味著一件事:這個工具的輸出邊界是可預期的,不會因為忘記開某個開關而出包。

順帶一個相關的事實:我搜遍整個程式庫,watermark 一詞零命中,輸出的成品不會被自動加上任何深偽標記或浮水印。內容進得來的把關很嚴,出去的東西則完全素顏,要不要標示合成內容,責任在使用者自己身上,後面法律段會回到這一點。

程式碼開源、模型不開源:接案前要讀的那張授權表

網路上流傳的 FaceFusion 介紹,十篇有九篇寫它「採 MIT 授權,便於二次開發與商業落地」。我把倉庫裡的 LICENSE.md 打開,裡面只有一行字:OpenRAIL-AS license,著作權人 Henry Ruhs,2026 年。GitHub 的倉庫頁也把授權顯示成 Other,無法歸入任何標準開源授權。MIT 之說從何而來不難猜,這個專案一直到 2025 年 3 月的 3.1.2 版都還是 MIT,同年 4 月的 3.2.0 起才換成 OpenRAIL-AS,抄舊資料的文章一路錯到今天。

OpenRAIL 屬於「負責任 AI 授權」家族,你可以用、可以改、可以再散布,但附帶使用限制條款,不是那種怎麼用都行的寬鬆授權。而它還不是商用判斷裡最重要的那一層。官方文件自己寫得明白:我們提供的模型資產,各有各的授權。把官方那張模型授權表讀完,會看到一幅紅綠交錯的地圖:

TechMoon 內文圖|FaceFusion 官方文件模型授權清單Pin
官方 Licenses 頁把每顆模型的授權逐項標色:綠色是 MIT 這類寬鬆授權,紅色是非商業(2026 年 9 月)
授權層代表項目授權商用空間
程式碼FaceFusion 本體OpenRAIL-AS可用可改,附使用限制
換臉預設hyperswap 系列(官方自研)ResearchRAIL只留研究用途
換臉經典inswapper_128(InsightFace)非商業不能商用
對嘴模型Wav2Lip非商業同上
臉部增強GFPGANApache 2.0相對寬鬆
臉部偵測YuNet(OpenCV)MIT相對寬鬆
偵測器群ArcFace、RetinaFace、SCRFD非商業不能商用

看出問題了嗎。預設裝好、預設啟動的換臉模型,正是官方 2025 年起自研的 hyperswap,掛 ResearchRAIL 授權,只留研究用途;退回經典選項 inswapper_128,那是 InsightFace 的非商業授權;想用對嘴功能,Wav2Lip 一樣非商業。周邊模型要一顆一顆看:增強的 GFPGAN 是 Apache 2.0、偵測的 YuNet 是 MIT,相對寬鬆,但預設偵測器 yolo_face 是 GPL 3.0,ArcFace 這類人臉辨識模型又是非商業。所以「開源等於免費商用」在這個專案上是明確的誤解:個人創作、教學演示、研究,預設管線直接可用;要接案、做收費影片、進商業產品,你得先在授權表裡把每一顆要用的模型挑出來確認,或者向權利方取得授權。這功課沒有人替你做,star 數更不會替你做。

官方自己說不建議新手安裝

安裝體驗上,FaceFusion 的 README 第一段就自曝:安裝需要技術能力,不建議新手嘗試。標準路徑是先用 conda 建一個 Python 3.12 的環境,再依你的硬體跑對應的安裝指令,CUDA 是 cuda@12 這類寫法,AMD 在 Windows 上走 DirectML,還有 MIGraphX、OpenVINO 等安裝選項,Apple Silicon 裝預設版、執行時掛 CoreML 後端。這份多後端清單是它相對同類工具的實力所在,NVIDIA、AMD、Apple Silicon、Intel 都有官方路徑,Docker 鏡像也一併提供。

硬體門檻官方給了明確數字:顯示卡記憶體 8GB 是下限,12GB 起比較安心。模型檔第一次執行時自動下載,換臉核心加偵測模型下來是數百 MB 等級,之後都留在本機。真的不想碰命令列的人有一條捷徑:官方的 Windows 與 macOS 一鍵安裝器,但那是付費商品,Windows 版 20 美元、macOS 版 30 美元,在官方的 Buy Me a Coffee 商店販售,Windows 版已經賣出超過一萬一千份。

求援管道要先知道:GitHub 的 Issues 頁面是關閉的,官方社群移到 Discord 與 Reddit。碰到安裝問題,翻官方文件的排困段比搜 issue 有效。

換臉核心的解析度帳,與「4K 輸出」的真相

介紹文常寫它「支援 4K 影片輸出」,這句話技術上成立,但要讀懂它的意思。現任預設的 hyperswap 核心,原生工作解析度是 256 像素見方,經典的 inswapper 更只有 128;官方 FAQ 說明過,InsightFace 基於倫理考量,拒絕釋出更高解析度的版本。FaceFusion 的工程解法叫 pixel boost,把臉部區域切小塊、逐塊以更高倍率重新換算,設定檔裡的選項一路排到 1024×1024。再加上臉部增強與畫面增強的處理器接力,輸出成品的解析度確實可以到 4K 容器。

但輸出解析度與換臉精度是兩件事。骨架是 128 或 256 像素等級的模型打的底,pixel boost 與增強模型做的是放大與修飾。從這個機制推回來,對「4K 級換臉」的合理期待是:大臉特寫經得起看,側臉、遮擋、快速動作就要靠遮罩工具與參數調校去救。工具提供了區域遮罩(眼睛、嘴巴、鼻子可單獨圈選保護)、臉部選擇器、臉部追蹤這整套周邊,就是承認核心模型有極限,需要你在前端處理素材、在後端修邊。

和 Deep-Live-Cam 二選一?其實是兩種工作

講到開源換臉,Deep-Live-Cam 是另一個繞不開的名字,兩者血統相連,Deep-Live-Cam 的換臉核心正是 FaceFusion 也保留的經典選項 inswapper,授權上的顧慮也一脈相承。但把它們放在一起選,其實是選兩種不同的工作。Deep-Live-Cam 星數將近十萬,主戰場是即時:一張照片進去,鏡頭畫面裡的臉立刻被換掉,接虛擬鏡頭進 OBS 直播,它的價值在「當下」。FaceFusion 的價值在「事後」:一支拍完的影片、一張定稿的照片,用工作佇列慢慢批次處理,模型選擇與修飾空間深得多。要做直播特效,去用前者;要做片子後製,留在這裡。硬要用 FaceFusion 直播,或用 Deep-Live-Cam 批次跑長片,都是在拿螺絲起子敲釘子。

同一條生態系裡還有幾個站內介紹過的鄰居。想讓照片裡的人動起來而非換臉,Nero AI Face Animation 是另一條路線;配音工程本身,Voice Pro 的 AI 配音處理的是對嘴之前的那一步;反向需求,想保護影片裡當事人的臉,Deface 的自動模糊做的是換臉的鏡像任務;而想生成能視訊通話的完整 AI 角色,可以看 CyberVerse 開源數位人

在台灣,先想清楚你要換誰的臉

工具與法律是兩條線,換臉在台灣的地圖其實畫得比多數人想的清楚。2023 年刑法增訂妨害性隱私及不實性影像罪專章,第 319 條之 1 到之 6,把深偽性影像從製作到散布全部納入刑事範圍,散布可處五年以下有期徒刑,意圖營利最重七年。注意這個專章保護的客體是性影像,換臉但不含性內容的場合走別的軌道:拿合成身分騙人,是詐欺;未經同意把別人的臉拿去做商業利用,民事上有肖像權侵害的求償空間;個人資料的蒐集利用還有個資法擋在中間。回到 FaceFusion 的處境還有一個特殊點:它那道拿不掉的內容閘門,等於在性影像這條最重的紅線前替社會也替你裝了保險,你刻意繞過它的意圖本身,就很難解釋成善意。

再加上前面提過的:輸出不加浮水印、不留深偽標記,揭露的責任完全在你。實務上的安全線不複雜:用自己的臉,或取得書面同意的臉;發布時講清楚是合成內容;商業用途先回頭把授權表讀完。三件事都做到,這個工具落在法律與倫理的正面側;三件事缺任何一件,風險就換你自己扛。

誰該現在裝,誰該先放回書籤列

該現在裝的人:有 8GB 以上顯卡、用得慣終端機、手上有影片或照片後製需求、素材是自己的臉或取得同意的臉,而且用途不涉營利。這群人拿到的是目前後製導向換臉工具裡最完整的一套:十一個處理器、工作佇列、多硬體後端,而且專案活得很健康,2026 年 7 月以來連發五個版本(3.7.1 到 3.8.3),3.9.0 在 9 月 3 日跟上,維護者自始至終就是 Henry Ruhs 一個人,社群在 Discord 與 Reddit。

先放回書籤列的人:想找一鍵式桌面 App 的(等官方安裝器也救不了不願意開終端機的人)、顯卡記憶體不到 8GB 的、用途是直播即時換臉的(去 Deep-Live-Cam 那篇),以及最重要的,想直接接案商用的人。接案前你需要一段安靜的時光把官方授權表逐顆模型讀完,確認自己要用的每顆都能商用,或準備好向權利方取得授權,這段功課沒有捷徑。入門順序則很單純:先讀官方文件的安裝頁確認自己的硬體對應哪個後端,Windows 與 macOS 用戶可以考慮付費的官方一鍵安裝器省掉環境功夫,裝好後第一支影片拿自己的臉試,被內容閘門攔下來時不用排查環境,那是這個工具的個性使然。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1135

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...