IDM-VTON 免費試衣實測:不用註冊就能把衣服穿上你的照片

同一個開源試衣模型有兩個線上入口:多數推薦文指向的 Replicate 版按秒收費,一次約 0.024 美元;論文作者自己的 Hugging Face 展示頁不用註冊就跑得動,這篇實際上傳照片換裝驗證,並拆解 CC BY-NC-SA 4.0 對商用畫下的紅線。

用 AI 摘要這篇文章:

想把網拍看到的上衣穿上自己的照片看看效果,上網搜「AI 虛擬試衣 免費」,點進去的網站常常要先註冊、不然就是試用幾張後跳出儲值視窗。這篇要講的 IDM-VTON 是這個題目裡被引用最多的開源模型,而且它有一個真的不用註冊、不用付費的入口,只是那個入口經常被推薦文章跳過:多數連結指向的 Replicate 頁面要按秒收費,真正免費的是論文作者放在 Hugging Face 上的示範頁。我實際用那個頁面換裝成功一次,這篇會把輸入輸出攤開給你看,也會講清楚哪些用途被授權條款擋下。

IDM-VTON 出自 2024 年 ECCV 論文「Improving Diffusion Models for Authentic Virtual Try-on in the Wild」,作者群任職於韓國科學技術院(KAIST),任務說起來很單純:給它一張人物照加一張衣服照,它輸出一張同一個人穿著那件衣服的照片。程式碼和模型權重都公開,GitHub 儲存庫累積超過五千二百個星標,到今天仍是許多試衣產品背後的引擎。

免費的入口,長在論文作者自己的示範頁上

作者在 Hugging Face 經營了一個叫 yisol/IDM-VTON 的示範空間(網址是 yisol-idm-vton.hf.space),介面是英文的,流程是:左邊上傳或用內建範例挑一張全身人物照,中間放一張衣服照,右邊按下 Try-on。就這樣,沒有註冊按鈕,從頭到尾沒有出現刷卡或點數的視窗。

IDM-VTON 官方 Hugging Face 示範空間介面截圖,左側人物照編輯區、中間衣服上傳區、右側輸出區,畫面上沒有任何價格或登入提示Pin
論文作者自己經營的示範空間:左邊人物照、中間衣服照、按下 Try-on 就開始,整個介面看不到價格也看不到登入按鈕。

我實際跑了一次給你看結果。人物照用頁面內建的範例,一位穿藕粉色無袖上衣、黑長褲站著的女子;衣服照選內建的另一張範例,一件寶藍色絲絨材質、V 領、側邊有綁帶的短袖上衣。送出後稍等一下,拿到兩張 768×1024 的成品:一張是遮罩圖,標出模型打算重畫的區域;另一張是最終輸出。輸出裡同一個人、同樣的姿勢和褲子,上半身換成了那件寶藍色上衣,絲絨的光澤、V 領的剪裁、側邊垂下來的綁帶都在,十根手指沒有黏在一起,看起來就是一張正常的服飾型錄照。

這次是透過它的介面 API 直接呼叫,全程沒有登入任何帳號。換句話說,「免費線上試衣」對 IDM-VTON 來說成立,前提是你找對入口。

被推薦文指到的 Replicate 版,按秒收費

那為什麼很多人會以為它要付費?因為網路上流傳的連結多數指向 Replicate 平台上使用者 cuuupid 上架的版本。那個頁面本身做得很完整,輸入參數、範例圖片、執行統計都有,但它是一個計費服務:模型跑在 Nvidia A100 80GB 顯卡上,費率每秒 0.0014 美元,頁面自己估一次大約 0.024 美元,換算成一美元可以跑四十一次,單次成本折合新台幣不到一元。我也試著不帶任何憑證直接呼叫它的 API,馬上收到 401 Unauthenticated,連跑都不給跑。

Replicate 平台上 cuuupid 上架的 idm-vton 模型頁截圖,顯示非商業使用標示、A100 80GB 硬體、單次約 0.024 美元與 Sign in to run 提示Pin
被推薦文指到的 Replicate 版:模型頁自述 non-commercial use only,跑在 A100 80GB 上,頁面估一次約 0.024 美元,執行前要先 Sign in。

累積的執行次數最能說明這條付費路線的規模:那個頁面顯示已經被執行超過 156 萬次。上架者 cuuupid 不是論文作者,他的 GitHub 自介寫著先前任職於 Replicate,模型頁也標明非官方帳號。平心而論,搬運本身沒有問題,程式碼本來就是公開的,頁面上也附了原文連結;只是「開源、免部署」和「免費」是兩件不同的事,你按一次 Try-on,就有人在替那塊 A100 付一次錢。

它怎麼把衣服穿上去:遮掉重畫的修補模型

IDM-VTON 的做法可以把「試衣」想成一種照片修補。模型先把你原本穿的衣服區域遮起來,再以衣服照片作為條件,在遮住的區域重新生成影像。它是拿 Stable Diffusion XL 的修補版當底座微調出來的,論文裡的關鍵改動是給衣服兩條並行的編碼路線:一條 CLIP 視覺編碼器負責衣服的高階語意,判斷這是什麼類型、什麼風格的衣服,送到生成過程的交叉注意力層;另一條平行的參考 UNet 保留衣服的低階細節,布料紋理、皺褶、圖案的位置和長相,送到自注意力層。再加上給衣服和人物各寫一段文字描述輔助,讓生成結果在「像那件衣服」和「像同一個人」之間取得平衡。

自動遮罩本身也是一小段工程。示範頁的程式碼裡載入了人體解析和骨架姿態估計兩個前處理模型,把照片裡的頭髮、臉、手臂、上衣區域切開,再依衣服類別組出要重畫的範圍,所以勾自動遮罩會多花幾秒鐘處理;不想用自動的,也可以改用手動筆刷自己塗,遮罩圈得好不好,直接影響換裝邊緣的自然度,我這次用的是自動遮罩,輸出也附了一張遮罩示意圖讓你檢查圈選範圍。

知道這個機制,就明白它的一些脾氣從哪來:它是用生成的方式畫出衣服,所以衣服以下的身體、背景、手部都有機會被連帶重畫;輸入照片越接近它訓練時看到的乾淨全身照,效果越穩。論文還提出一種用一對人物照加衣服照做個人化微調的方法,可以讓特定商品的上身效果更忠實,不過這需要自己下載權重訓練,線上版本沒有提供。

想跑得順,先備好這幾件事

示範頁和 Replicate 版的參數大致相同,動手前把這幾件事備好,成功率會高很多。

人物照盡量找直立 3 比 4 的全身照,背景單純、四肢不要交疊。如果照片比例不是 3 比 4,介面裡有自動裁切的選項可以打開,我自己那次是關著的,因為範例照本身就是標準比例。遮罩可以手動塗,也可以勾自動生成,一般照片交給自動就夠。第一次摸不著頭緒的話,介面兩側內建了官方範例圖,點一下就能載入試跑,先看看它的品味合不合你意,再上自己的照片。

衣服要先分類。模型分上身(upper_body)、下身(lower_body)、連身(dresses)三類,選錯類別效果會明顯變差,因為不同類別對應不同的遮罩生成方式;連身類別在 Replicate 版會自動換用另一組訓練權重,示範頁則是一套權重跑到底。衣服照用電商那種白底商品圖最穩,官方說明寫商品圖或別人穿著的照片都接受,但商品圖的干擾最少。

進階參數保持預設就好。去噪步數預設 30、上限 40,拉高不一定更好且更花時間;亂數種子固定時,同一組輸入會得到相近的結果,想多試幾個版本就換種子。衣服的文字描述欄可以填一句話輔助生成,不過 GitHub 上有人開 issue 質疑這個欄位到底有沒有作用,我自己那次照填,你把它當可有可無的保險就好。輸出拿到後建議當場下載保存,這個空間的成品放在暫存網址上,不保證保留多久。

想拿來做生意的人,先看授權這道牆

這是整篇最需要先講清楚的地方:IDM-VTON 的程式碼和模型權重採用 CC BY-NC-SA 4.0 授權,GitHub 的 README、授權條款全文、Hugging Face 模型卡、連 Replicate 的模型頁開頭都一致標明 Non-Commercial。NC 代表非商業使用,SA 代表如果你改作了它,衍生成果要用同樣的授權釋出,不能收起來當私有資產。

對個人來說,把自己照片拿去試衣服、做穿搭筆記、貼到社群分享,都在授權範圍內。但「虛擬試衣」最自然的變現場景,恰恰是被擋掉的那個:電商用它做試穿功能、服飾賣場用它生成模特兒著裝圖、穿搭 App 把它做成付費功能,這些都是商業使用,不在授權範圍內。

這條紅線不是理論問題。GitHub 上編號 160 的 issue 標題就叫 Commercial license,從 2024 年 11 月開到現在,十一則留言全是有興趣的開發者互相留聯絡方式談合作,論文作者群從頭到尾沒有出面,也沒有公告任何商用授權的管道。想合法商用的人,現階段只能自己寫信去問,或另尋有商業授權的方案。

照片隱私與其他要先知道的事

照片會離開你的電腦。無論走免費頁或 Replicate,人物照片和衣服照片都會上傳到對方的 GPU 伺服器運算,模型並非在瀏覽器裡跑。成品還放在一個不需要登入就能開啟的暫存網址上,我這次拿到的兩張輸出,路徑就開在對方的暫存目錄裡,誰有網址誰就能開;Replicate 的資料保存政策你可以在它的隱私頁再確認。拿自己的照片試衣前想一下這一點,跟把照片交給任何雲端修圖服務是同一種交換條件。

專案本身的維護狀態也要誠實說:GitHub 儲存庫最後一次更新停在 2025 年 3 月,到今天約十九個月沒有新提交。146 個開著的 issue 持續有人留言,內容從商用授權、推理速度太慢,到怎麼做個人化微調都有,最新的留言出現在 2026 年 9 月,但等不到作者的修復。模型本身仍可下載使用,Hugging Face 上的權重累積下載兩萬五千次,試衣頁也還活著,只是它已經是完成品狀態,不會再長出新功能或修正問題。

最後是額度問題。我匿名跑了一次成功,但這條免費路線背後靠 Hugging Face 的 ZeroGPU 免費 GPU 額度支撐,碰到高峰要排隊,匿名身分能連續跑多少次,沒有保證。如果你要批次處理一整季的商品圖,免費頁撐不住,那是 Replicate 計費版或自架存在的原因;自架的話儲存庫附了 Docker 和推論腳本,顯卡需求和環境安裝是另一個量級的工程,這裡不展開。

順帶一提輸出的規格:兩張成品都是固定的 768×1024 直式 PNG。這個尺寸和它訓練用的 VITON-HD 資料集同規格,論文團隊為了讓模型學會更多服裝類型,又混入了 DressCode 資料集,README 裡對兩個資料集的下載與目錄結構都有交代。對讀者的實際意義是:不管你上傳的照片多大,拿到的就是這個尺寸,要放社群或商品頁,自己再縮放裁切就好。

誰該用、誰該繞路

給一般讀者的結論很短:想免費、快速看一件衣服穿在自己身上的樣子,去作者的 Hugging Face 示範頁,備一張 3 比 4 全身照加一張衣服商品圖,照片規格對了很快就會有答案。想把它接進產品或商業流程,先停一下,授權不允許,而且沒有現成的洽談管道。想要穩定的服務等級和 API 產能,Replicate 的計費版可以把基礎設施外包出去,小量使用的成本不高,但你付的錢換到的只有算力,授權條款沒有跟著改變。

如果跑出來的結果不滿意,調整的方向就那幾個:換一張姿勢更簡單、四肢不交疊的人物照,效果差異最大;再來是換亂數種子多試幾次,生成模型同一組輸入在不同種子下會給出不一樣的成品;衣服邊緣不乾淨的話,改用手動遮罩把範圍圈準。它終究是用畫的,把期望放在「看個大概上身效果」,比放在「可直接當商品圖」更貼近它的能力範圍。

如果你對「把人物照片交給 AI 處理」這類工具的界線有興趣,可以看我們先前對 AI 穿搭評分工具 Outfitify 的實測、開源換臉工具 LunaLite,以及 照片年齡偵測工具的隱私邊界,同一批問題在每個工具上的答案都不一樣。

虛擬試衣的技術已經走到免費、匿名、一張照片就能試的程度,這是它值得試的地方;而它被論文授權畫出的使用範圍,比多數人以為的窄,這是它值得先想清楚的地方。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 1828

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...