TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南
TechMoon 科技月球
WordPress、SEO 與 AI 工具實測指南

Qwen 團隊 9 月 20 日開放 Qwen-Image-2.1 權重:視覺生成核心 7B、官方榜 60.28 分以 0.46 分差排在 Nano Banana 2.0 之前,但家族前六個 Apache-2.0 版本之後首次改採僅限非商業研究的授權,完整下載約 30.8 GiB,商用需另行申請。
用 AI 摘要這篇文章:
2026 年 9 月 20 日,Qwen 團隊發布圖像模型 Qwen-Image-2.1,把文字生圖、圖片編輯與原生透明圖輸出裝進同一套可下載的權重,視覺生成核心 7B 參數。發布當天社群最熱的說法是「7B 小模型贏過 Google 的 Nano Banana 2」,這句話對了一半:分數確實略高,但榜單是 Qwen 自己蓋的,贏面只有 0.46 分,而且同一張榜上還有六個模型排在它前面。真正影響採用決策的變動藏在授權條款裡:這是 Qwen-Image 家族連續六個 Apache-2.0 版本之後,第一次換成僅限非商業研究用途的授權。
這次發布不是臨時搶跑。GitHub 儲存庫與 Hugging Face 模型頁都在 9 月 14 日建立,Diffusers 的整合程式碼 9 月 18 日就合併進主線,9 月 20 日當天官方部落格、權重下載與五個推論工具鏈一起公開。對照官方儲存庫的 News 清單,發布日同時是 Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V 的 Day-0 支援日,其中 SGLang 的支援 PR 在 9 月 20 日上午合併,Diffusers 更早兩天完成。同一個九月,Qwen 才剛發表過即時翻譯語音模型 Qwen3.8-LiveTranslate,圖像與語音兩條產品線都在趕節奏。

型號本身延續 Qwen-Image 系列的路線:文生圖與圖片編輯共用一個模型,最多接收 10 張參考圖做多人合成、穿搭組合或角色分鏡;局部編輯支援圈選、塗抹標記與獨立遮罩三種指定方式;原生輸出 2K 解析度,建議比例有七種,從 2048×2048 的正方形到 2752×1536 的橫幅。官方定位的四項改進裡,最實用的是透明圖能力:模型可以直接生成帶 Alpha 通道的 RGBA 圖、編輯既有透明圖層,或從一般照片抽出主體。這些能力過去散落在 2025 年 12 月的 Qwen-Image-Layered 等獨立模型裡,現在收進同一套權重,對貼圖、商品素材與簡報元件這類需要後續排版的產出,省掉一道去背手續。
輸出品質之外,官方也把「生成素材可再加工」當成賣點:透明圖能接收進來編輯,主體抽出來後可以重組到新場景,遮罩指定範圍內的修改不動其他區域。換句話說,模型輸出的定位從「一張成品圖」往「可拆解、可重組的圖層素材」移動,這對設計工作流的價值通常比總分多個一兩分更直接。當然,頭髮邊緣、半透明玻璃、煙霧這類去背難題,官方示範圖不等於全部過關,實際使用仍要逐張檢查邊緣。
官方發布圖把 Qwen-Image-2.1 標在 60.28 分,排名第 7,前十名的分布如下:

| 排名 | 模型 | 總分 |
|---|---|---|
| 1 | GPT Image 2.5 Sunburst | 67.01 |
| 2 | GPT Image 2 | 64.69 |
| 3 | Grok Imagine 2.0 | 63.47 |
| 4 | Qwen Image 3 Pro | 62.36 |
| 5 | Muse Image | 62.34 |
| 6 | MAI Image 2.5 Pro | 61.02 |
| 7 | Qwen-Image-2.1 | 60.28 |
| 8 | Nano Banana 2.0 | 59.82 |
| 9 | GPT Image 1.5 | 59.65 |
| 10 | Seedream 5 Pro | 59.53 |
Qwen-Image-2.1 與 Nano Banana 2.0 差 0.46 分,再往後是 Nano Banana Pro 的 59.45 與 Qwen Image 2.0 Pro 的 57.84。「超越 Nano Banana 2」的說法要附帶三個但書:分差不到半分;前面還有六個模型,其中一個是 Qwen 自家的閉源型號 Qwen Image 3 Pro;這張榜的出題者與閱卷者都是 Qwen。榜上第一名是 GPT Image 2.5 家族的 Sunburst 版本,OpenAI 在九月上旬才隨ChatGPT Images 2.5 更新把它推到全方案。
榜單顯示的訊號有兩層。第一,Qwen-Image-2.1 已經擠進高階模型的競爭區間,與榜首相差 6.73 分。第二,就目前公開資訊,它是這張榜前十名裡唯一提供權重下載的型號;家族前代的 Qwen Image 2512 還留在榜上,52.06 分距離前十名門檻有一段距離。分數之外,這點才是開放權重陣營真正的進展。
這張成績單來自 Qwen-Image-Bench,官方論文已發表在 arXiv。依資料集說明,評測包含 1,000 組專家設計的中英雙語提示詞(長短各半),從畫質、美感、指令對齊、真實世界忠實度與創意生成五個大柱往下拆成 23 個子能力、56 個細項,文字渲染、世界知識、故事分鏡、設計應用都在子能力清單裡。閱卷交給裁判模型 Q-Judger,它以 Qwen3.6-27B 為底,用 13 萬餘組雙語標註對與 80 位專業標註者訓練,官方公布它與人類專家評分的排序一致性為 Spearman 0.92。
兩個前提要留意。第一,現行榜單成績是以中文提示詞生成圖片後評分,英文提示詞的結果 Qwen 註明稍後發布,等於目前只有半份考卷;中文提示詞對以英文生態為主的模型是否構成劣勢,發布內容沒有說明。第二,出題、參賽、閱卷都與 Qwen 同源,0.92 的一致性也是自家公布的數字,第三方複測出現之前,「領先」一詞只能停在官方榜層級。截至 9 月 21 日,Artificial Analysis 的圖像模型頁面還沒有 Qwen-Image-2.1 的條目,獨立驗證尚未補齊。
下載權重之前該看的文件是 LICENSE,這次它比分數重要。Qwen-Image-2.1 採用 Qwen Research License Agreement(條款日期 2026 年 9 月 20 日),條款把「非商業」定義為僅限研究與評估用途,並明文寫著未另行取得商業授權不得作商業使用,商業授權要寫信到條款列出的信箱申請。散布權重或修改版本時,必須附上授權副本、在修改過的檔案加上顯著標示,並保留 Qwen 的版權聲明;權利人是杭州通義實驗室科技有限公司。照一般對「商業用途」的理解,替客戶產出收費素材、放進付費訂閱服務、用輸出支撐公司產品都在禁止之列,具體邊界仍要以條款本文與個案合約判斷。
放在家族歷史裡看,這是一次明確的轉向。從 Qwen-Image、Qwen-Image-Edit、Qwen-Image-Edit-2509、Qwen-Image-Layered、Qwen-Image-Edit-2511 到 Qwen-Image-2512,這六個在 2025 年 8 月到 12 月間陸續上架的前代模型,在 Hugging Face 上全部標 Apache-2.0,下載後商用原則上沒有額外障礙;Qwen-Image-2.1 與它同日推出的兩個提示詞重寫模型,則都換成研究授權。同場加映的對比是,評測用的裁判模型 Qwen-Image-Bench 與資料集本身仍維持 Apache-2.0:量尺開放,被量的權重收緊。對照其他實驗室的做法,例如上海 AI 實驗室的 Atria Dawn Preview 以 MIT 授權涵蓋 744B 權重,Qwen 這一步等於把「開放」的定義往回收了一格。
官方部落格以「開源」描述這次發布,但以授權術語來說,「開放權重」是更準確的說法。權重可以下載、可以在自己的環境執行,修改與散布也有條件允許,商用則需要另外談。對照前代直接可商用的 Apache-2.0,這次的開放是量的開放、權的緊縮。
「只有 7B」是行銷數字,硬碟要付的帳是另一回事。7B 指的僅是負責生成影像的 DiT 元件;要讓模型跑起來,還需要理解文字與參考圖的 Qwen3-VL 8B 編碼器,以及處理影像壓縮還原的 VAE。以 Hugging Face 上的檔案實際加總,七個 BF16 權重檔合計約 30.8 GiB:生成核心兩檔 13.25 GiB、文字編碼器四檔 16.33 GiB、VAE 一檔 1.26 GiB,編碼器比生成核心還大。若換算成硬碟標示常用的十進位 GB,約 33.1 GB。

官方模型卡沒有給出單一最低顯示記憶體數字,只提供 CPU offload 選項讓記憶體不足的設備把部分模型暫放系統記憶體,速度會變慢。想省下載量的人還要注意:官方建議搭配的兩個提示詞重寫模型(Qwen3.5-VL 9B 微調,文生圖與編輯各一)也要另計容量,兩者同樣是研究授權。第一次嘗試前,先確認硬碟空間與顯示卡條件,別把 7B 直接等同「任何家用電腦都能跑」。
效率設計上,模型對文字與影像採不同粒度的注意力:文字走 token 級因果遮罩,影像走區塊級遮罩,並以前綴 KV 快取把參考圖與編輯指令在第一步算好、後續去噪步驟重用。官方說這項設計的優勢在多圖輸入場景最明顯,多張參考圖共用的前綴只需要計算一次。排程器採 Flow Matching 搭配 Euler 離散化與動態偏移。
Nano Banana 2 是 Google 今年 2 月 26 日發表的閉源圖像模型,官方定位是 Nano Banana Pro 的能力配上 Gemini Flash 的速度,主打進階世界知識與主題一致性,透過 Gemini app、Search、Ads 與 AI Studio、Vertex AI 等產品和 API 提供。兩者的比較本質不是誰的分數高,而是使用方式完全不同:一邊是把 30.8 GiB 權重放進自己的機器、資料不出門、流程自己控制;另一邊是不用管模型檔與 GPU 環境,換取素材進雲端與按用量計費。
對需要在自管環境處理敏感素材、或想研究推論加速與工作流整合的團隊,就目前公開資訊,Qwen-Image-2.1 是這張榜前十名裡唯一能下載權重的選項。追求即時世界知識與免維護介面的使用者,雲端服務仍然省事得多。把兩者寫成對決,反而掩蓋了它們服務的是兩批需求。
同一個任務在兩邊的走法也不同。想做「商品照換背景、直式社群圖與橫幅廣告三種版型」,雲端路線是在對話介面裡反覆下指令、逐張生成;權重路線是把商品參考圖與遮罩餵進本地工作流,透明圖層直接疊上不同底圖,素材不出機器,但要自己處理顯示卡與環境。前一種買的是方便,後一種買的是控制權,0.46 分在這個抉擇裡幾乎不起作用。
不寫程式的使用者可以從官方 Demo 入手:Hugging Face Spaces 上有 Qwen-Image-2.1 頁面,官方另註明中國大陸使用者可經 wuli.art 免費使用包含透明背景在內的全部功能。ComfyUI 使用者可直接抓官方範本,文生圖與圖片編輯各一份,相容權重由 Comfy-Org 打包,不用自己轉檔。
Python 路線的需求是 torch 2.4.0 以上、transformers 5.17 以上,diffusers 要裝 GitHub 主線版本,一個 QwenImage21Pipeline 同時處理文生圖與圖片條件生成。要自建服務的話,vLLM-Omni 提供前綴 KV 快取、CUDA Graph、FP8 量化與張量平行,SGLang-Diffusion 走多 GPU 平行與記憶體卸載路線,LightX2V 針對消費級顯卡的速度與記憶體最佳化。硬體上除了 NVIDIA,官方也列出 AMD Radeon 的 ROCm 路徑,並透過 FlagOS 支援八種晶片平台的預先建置映像。
研究圖像模型與推論工程的人:五條工具鏈與範例程式碼都已就緒,可以直接進入複現與加速實驗,生成預設是 40 個去噪步、2048×2048。
已在使用 ComfyUI 的創作者:先在官方 Demo 確認輸出風格符合需求,再決定是否下載完整權重與兩個重寫模型,兩者授權條件相同。
考慮商用的團隊:先把授權當成第一道關卡。客戶專案、付費產品、營利素材都在現行授權範圍外,要嘛走條款信箱談商業授權,要嘛評估 Qwen Image 3 Pro 這類官方 API,或沿用家族裡仍為 Apache-2.0 的前代型號。
只想生成圖片的一般使用者:不需要動。雲端生圖服務的體驗沒有改變,這次發布改變的是可下載權重生態,線上工具不受影響。
第三方獨立評測還沒有出現,英文提示詞的榜單成績也尚未發布。商用授權的費用與條件是申請制,未公開。實際生成品質、速度與不同顯示卡上的資源占用,需要使用者與第三方驗證補齊;本文的能力描述以 9 月 20 日官方文件刊載內容為準。
這些結論的時效押在三件事上:第三方榜單收錄 Qwen-Image-2.1、Qwen 公布商用授權條件或調整授權條款、英文提示詞榜單發布。任何一件發生,分數與授權的結論都需要重新檢查;以圖像模型目前一到兩個月一代的節奏,超過這個週期後請以官方頁面現況為準。