想像一個很常見的場景:你要替小店做一張活動海報,得先用 AI 生一張圖,再找去背工具把主角摳出來,最後還要換另一個修圖工具,把手上多出來的東西擦掉。三個工具、三次匯出,每轉一手,畫質和耐心都會掉一點。Qwen-Image-2.1 想解決的,就是這種來回折騰。這次 Qwen 團隊把生圖、修圖和去背放進同一個開源模型,方向很明確。

🔔 不錯過任何精彩內容

立即訂閱我們的 LINE 或將本站設為 Google 偏好來源,掌握最新資訊!

根據官網的介紹(Qwen 官方部落格),Qwen-Image-2.1 把文生圖與圖片編輯整合在同一個模型裡,視覺生成部分只有 7B 參數,還原生支援透明圖片的生成與編輯。這篇文章會先整理官方公開的功能,再把很多人最在意的「圖片裡能不能生出繁體、簡體中文字」講清楚。最後加碼介紹社群釋出的 GGUF 版本,讓顯示卡沒那麼強的人,也有機會在自己的電腦上試試看。要先說一聲,中文字這一段,官方並沒有給出明確保證,我會把能查到的資料都攤開來。

Qwen-Image-2.1 是什麼?

Qwen-Image-2.1 是 Qwen 團隊在 2026 年 9 月 20 日開源的圖片模型,把文生圖與圖片編輯整合在同一個模型裡。官方模型卡說明,它的視覺生成部分是 7B 參數、32 層 Single-Stream DiT,目標是在畫質、推論效率與成本之間取得平衡。實際上,7B 對現在的開源圖片模型來說算是輕量,門檻比動輒更大的模型低一些。對一般玩家來說,這點比跑分好看更重要。

官方把這次更新歸納成四個方向:輕量高效、原生透明加上生成編輯一體化、支援最多 10 張參考圖的靈活編輯,還有更好的字體排版與人像質感。另外,模型用 Qwen3-VL 8B 同時讀懂文字指令和參考圖,再搭配一個支援透明度的 RGBA VAE。這些名詞看起來很硬,簡單講就是:它一次看得懂你的話,也看得懂你給的圖。

官方還提到,透過混合粒度注意力(Mixed-granularity Attention)與前綴 KV Cache 重複使用,多張圖片輸入時的效率提升特別明顯。白話一點,就是你丟進去的參考圖越多,它越不需要每一步都重新讀一遍。我的看法是,這種不炫技、但省時間的改動,最能看出團隊是想讓人天天用,而不是只拿來發新聞稿。

原生透明背景與照片去背有什麼用?

原生透明背景,是指模型直接生成帶有透明度資訊的 RGBA 圖片,不用事後再去背。過去 AI 生圖之後,只要想拿去做貼圖、簡報或商品圖,通常得再跑一次去背工具,邊緣還常常有毛邊。Qwen-Image-2.1 讓你在提示詞裡直接要求透明背景,出來的圖就是可以直接疊在別的畫面上的素材。這對做內容的人來說,省下的不只是時間,還有一堆邊緣修補的火氣。

官方建議的提示詞格式,是先寫「This is an RGBA image with transparency.」,接著放你的畫面描述,最後補上「The image has alpha channel and the background is transparent.」。官方範例是一張卡通小龍貼紙。除了生成,透明圖層也能繼續編輯,一般照片也能直接抽出指定主體,變成透明素材。

舉個例子,如果你經營一個小型電商,可以先請模型生出透明背景的商品圖示,直接放進自己的版型,或是拿一張實拍照抽出主體來去背。我的看法是,去背最能看出統一模型的價值:生成、抽取、修改都在同一個地方完成,圖層之間不用來回匯出。不過官方展示的畢竟是挑選過的範例,實際邊緣品質,還是要用你自己的圖去試。

多張參考圖與局部修改可以做到什麼程度?

多參考圖編輯,是讓模型同時參考多張素材圖,再依照你的文字指令組合成新畫面。官方說 Qwen-Image-2.1 最多支援 10 張參考圖,GitHub 上展示了兩個很直覺的例子:用六張個人肖像組成一張團體照,以及用模特兒、衣服、鞋子、包包與帽子共五張參考圖,組出完整穿搭。這種玩法很適合虛擬試穿、活動大合照,或需要固定角色的內容創作。想像你要替小品牌做型錄,過去得請人拍、修、合成,現在有機會先用這個方式做出概念稿。

局部修改則是另一個亮點。官方說明可以直接在圖上用圈選、塗抹標註,或另外提供一張 Mask,指定要改的位置。官方展示的例子是用圈選同時處理三件事:拿掉手錶、改變髮色、換掉衣服。官方也強調會保留人物與商品的辨識特徵,這對電商與人像類的用途特別重要。

官方 GitHub 還展示了兩種延伸用法:用一張自拍生成全景圖,以及從角色三視圖做出故事分鏡。這兩個範例看起來已經不只是修一張圖,而是在做視覺敘事的前置作業。對做角色設計、廣告分鏡或漫畫草稿的人來說,這是比較有想像空間的方向。不過分鏡的連貫程度,還是要看你實際丟多少參考圖、下什麼指令。

不過,有一位設計師在知乎發表了 13 組實驗、196 張圖的實測,除了稱讚中文排版、原生透明與多圖身份保持,也點出短板:「替換」有時會變成「新增」,而且編輯時整張圖可能被輕微重繪。這是個人測試,但正好提醒我們別把局部修改想成 Photoshop 的圖層蒙版。我的建議是,重要的圖改完之後,一定要拿原圖比對一次。

圖片裡的中文字(繁體、簡體)到底能不能生成?

圖片裡的中文字生成,指的是模型能不能在畫面中把你指定的漢字正確寫出來,而 Qwen-Image-2.1 官方目前沒有明確保證繁體或簡體。官方部落格提到,這次文字生成除了內容本身,也會考慮字體樣式、版面,以及它和整體構圖的關係。但我在官方部落格、GitHub 與模型卡的內容裡,都沒有看到明確寫出支援繁體中文或簡體中文。所以「能不能生中文字」的答案是:多半可以,但官方沒有背書。

初代 Qwen-Image 在 2025 年釋出時,官方明確主打中文字生成,並說在中文文字生成上明顯領先當時的模型。這讓大家對 2.1 期待很高,但要小心,那是上一代的說法,不能直接套用。下面把我查到的資料整理成表格,讓你看每個說法的來源和分量。

來源 測試對象 中文字相關說法 參考價值
Qwen 官方(2.1) Qwen-Image-2.1 只說文字生成會兼顧字體、版面與構圖,沒有明確寫支援繁體或簡體 最權威,但沒有給中文保證
Qwen 官方(初代,2025 年) 初代 Qwen-Image 明確主打中文字生成,並稱明顯領先當時的模型 只能參考,不能直接套到 2.1
知乎設計師實測 Qwen-Image-2.1(196 張圖) 認為中文排版是明顯的強項 個人測試,語境偏簡體
六張本機樣本觀察 Qwen-Image-2.1(社群 4-bit 權重) 短中文字可辨,較大的字也能正確呈現 樣本太少,作者自己也強調不能一般化
數位時代實測 初代 Qwen-Image 單行繁體能生成但有錯字,多行繁體仍不足 對象是初代,但屬於繁體實測

從表格來看,短句、大字的中文成功率比較有把握,這點有幾個獨立來源可以互相印證。至於繁體,目前只有初代的實測和零星樣本,大致的結論是單行多半能過關,多行長文還是容易出錯。簡體的資料比較多,我猜主要是因為測試者的語境不同,不代表模型真的偏愛簡體。商業用途我會更保守:畫面交給模型,文字自己用設計軟體疊上去。

如果你打算用它做含中文的海報或封面,有幾個做法可以降低翻車機率。第一,把要出現的文字用引號清楚寫在提示詞裡,字數盡量短。第二,一次只放一兩行,避開小字與長段落。第三,出圖後一定要逐字檢查,尤其是筆畫多的字和繁體字形。最保險的方式,是直接用官方 Demo 拿你自己的繁體文案測一輪,再決定要不要用它出正式稿。

Qwen-Image-2.1 怎麼開始用?

Qwen-Image-2.1 的使用方式有兩條路:直接開官方 Demo 體驗,或是把開源權重載到自己的電腦上跑。官方模型卡附有 Hugging Face 的 官方 Demo,不用安裝任何東西就能先測提示詞與效果。想確認繁體中文字表現的人,我建議先從這裡開始。要在自己的電腦跑的話,官方範例是以 NVIDIA 顯示卡(CUDA)示範,需要照著步驟準備環境。

第一步,安裝環境。官方需求是 PyTorch 2.4.0 以上、Transformers 5.17 以上、從 GitHub 安裝的最新版 Diffusers,再加上 accelerate 與 pillow。這裡要注意 Transformers 的版本比較新,舊環境可能要先升級。

第二步,載入模型。用 Diffusers 的 QwenImage21Pipeline 載入 Qwen/Qwen-Image-2.1,官方範例使用 bfloat16 精度。文生圖預設是 40 個推論步數、2048 x 2048 的解析度,官方說這款原生支援 2K。

第三步,選擇圖片比例。官方建議直接從下表挑尺寸,不要隨便改寬高,以免影響構圖與顯示記憶體用量。

比例 官方建議尺寸 我的用途建議
1:1 2048 x 2048 社群貼文、頭像、貼圖
4:3 2400 x 1792 簡報配圖、部落格內文圖
3:4 1792 x 2400 直式海報、商品圖
3:2 2528 x 1696 相片風格的橫式構圖
2:3 1696 x 2528 人像、直式封面
16:9 2752 x 1536 網站橫幅、影片封面
9:16 1536 x 2752 短影音封面、手機直式圖

第四步,編輯圖片。把原圖傳給 pipeline 就能做單張編輯,多張參考圖則傳入圖片清單。要做透明圖,記得使用前面提到的官方提示詞格式。如果想讓短提示詞更穩,官方另外提供 Qwen-Image-2.1-PE-T2I 與 Qwen-Image-2.1-PE-I2I 兩個提示詞改寫模型。有社群測試者的比較就認為,沒有使用官方提示詞改寫器,是實測和宣傳落差的最大來源。

第五步,處理 VRAM 不足。官方的建議是啟用 enable_model_cpu_offload,讓部分模型暫時放到 CPU 端,代價是速度通常會慢一些。另外 ComfyUI 從第一天就原生支援,也提供文生圖與圖片編輯的範例工作流程。授權方面,模型採用 Qwen Research License,要商用的人,請先自己讀過條款。

社群 Qwen-Image-2.1 Uncensored GGUF 是什麼?

Qwen-Image-2.1 Uncensored GGUF 是社群成員把官方 Qwen-Image-2.1 權重轉成 GGUF 量化格式的版本,方便在 ComfyUI 本機執行。這個版本放在 Hugging Face 的社群模型頁面上,由帳號 abenzerps 發布,並不是 Qwen 官方推出的。模型頁面寫明,它是用原始上游權重做的量化,來源模型就是 Qwen/Qwen-Image-2.1。所以它的能力來自官方模型,只是換成比較容易載入、也壓縮過的檔案格式。

這裡的「無內建過濾」要這樣理解:模型頁面說明這個版本沒有內建安全檢查器或內容過濾器,會依照提示詞直接生成,包含成人與敏感內容,不會拒絕或輸出黑圖。換句話說,它指的是沒有附帶把關機制,並不是模型被重新訓練,也不是多了什麼特別的能力。輸出會變成什麼樣子,取決於你的提示詞與執行環境。

這個版本同樣採用 Qwen Research License,頁面上也附有檔案校驗碼(SHA256SUMS),下載後可以自己核對。我的看法是,第三方轉檔最需要注意的是來源與版本,畢竟你信任的是那位轉檔者,而不是 Qwen 官方。所以如果沒有一定要用,先從官方版開始會比較踏實。

GGUF 版要選哪個量化檔案?

量化檔案,是把模型壓縮成較小的體積,用一點畫質換取更低的硬體門檻。這個 Hugging Face 頁面一口氣列出很多版本,容易讓人眼花。頁面推薦的是 Q4_K_M,理由是檔案大小與畫質之間的折衷比較好。下表整理的是頁面列出的 Uncensored 版本。

版本 檔案大小 檔案格式 我的建議
BF16 14.23 GB gguf VRAM 夠大、想要最接近原版的人
Q8_0 7.59 GB gguf 想接近原版、又想小一點的人
Q6_K 5.88 GB gguf 畫質與大小的中間選項
Q5_K_M 5.22 GB gguf Q4_K_M 不夠用時的升級選項
Q4_K_M 4.60 GB gguf 頁面推薦,多數人先從這個開始
Q4_0 4.15 GB gguf 最小的 GGUF 選項,一般來說位元越低越吃畫質
FP8 6.63 GB safetensors 不是 GGUF 格式,載入方式不同,要留意
INT8 ConvRot 6.76 GB safetensors 同樣不是 GGUF 格式
NVFP4 4.20 GB safetensors 同樣不是 GGUF 格式
MLX 4-bit、6-bit、8-bit 4.00 GB、5.78 GB、7.56 GB safetensors 給 Apple 平台使用的版本

要提醒的是,檔案大小不等於整套流程需要的記憶體。除了擴散模型,還要搭配文字編碼器與 VAE:BF16 的文字編碼器約 17.53 GB,INT8 版約 9.35 GB,VAE 約 676 MB。頁面建議的配置是 Q4_K_M 加上 INT8 文字編碼器,把擴散模型放在 GPU 的 VRAM,文字編碼器放在系統記憶體。因為文字編碼每個提示詞只跑一次,頁面說這樣可省下 9 到 17 GB 的 VRAM,對生成速度幾乎沒有影響。

我覺得這是最容易被誤會的地方。很多人看到 4.6 GB 就以為 8 GB 顯示卡輕鬆搞定,實際上你還得準備約 9 GB 以上的系統記憶體給編碼器,再留一些空間給 ComfyUI 與生成過程。買硬體或下載檔案之前,先把整套加起來算一遍,會少走很多冤枉路。

GGUF 版怎麼在 ComfyUI 上跑?

在 ComfyUI 跑 GGUF 版,要先下載三種檔案,再裝上支援 Qwen-Image 2.1 的 GGUF 節點。整個流程不算難,但步驟有點多,卡關的地方通常是節點版本。我把頁面上的做法整理成六個步驟,照著做就行。

第一步,下載檔案。擴散模型選一個 GGUF,頁面推薦 Q4_K_M,文字編碼器選 qwen3vl_8b_int8_convrot 或 qwen3vl_8b_bf16,另外下載 qwen_image_2.1_vae_bf16 這個 VAE。檔案都放在同一個 Hugging Face 倉庫裡,不用到處找。

第二步,放對資料夾。擴散模型放進 ComfyUI/models/diffusion_models,文字編碼器放進 ComfyUI/models/text_encoders,VAE 放進 ComfyUI/models/vae。放錯位置的話,節點裡就選不到檔案。

第三步,安裝 GGUF 節點。頁面建議使用 leejet 維護的 ComfyUI-GGUF 分支,到 ComfyUI/custom_nodes 資料夾裡,用 git clone 下載它。如果你之前裝的是舊版 city96 分支,遇到 Unknown model architecture 的錯誤,就換成這個分支。裝完之後,記得重新啟動 ComfyUI。

第四步,設定節點。擴散模型用「Unet Loader (GGUF)」載入,文字編碼器用一般的「CLIPLoader」,type 要設成 qwen_image,VAE 則用「VAELoader」。這三個載入節點缺一不可。

第五步,套用官方範本。Comfy-Org 提供了文生圖與圖片編輯兩個工作流程範本,載入後把預設的 UNETLoader 換成「Unet Loader (GGUF)」就能開始。這樣就不用自己從空白畫布接線。第一次建議先跑範本的預設設定,確認能出圖再調參數。

第六步,處理 VRAM 不足。如果出現記憶體不足的錯誤,頁面建議用 --lowvram 參數啟動 ComfyUI。同時保持擴散模型在 GPU、文字編碼器放在系統記憶體的配置,通常就能省下不少空間。

官方版和 GGUF 社群版該選哪個?

官方版與 GGUF 社群版的差別,在於發布者、檔案格式與硬體門檻,能力則同樣來自 Qwen-Image-2.1。這樣說有點抽象,我直接放成表格,你可以對著自己的電腦挑。挑選的關鍵其實不是誰比較強,而是你現在手邊有什麼設備。

比較項目 官方 Qwen-Image-2.1 社群 Uncensored GGUF
發布者 Qwen 官方 社群帳號 abenzerps
主要檔案格式 safetensors(BF16) 以 GGUF 為主,另有 FP8、INT8、NVFP4、MLX
主要使用工具 Diffusers、ComfyUI、vLLM-Omni、SGLang 等 ComfyUI 加上 ComfyUI-GGUF 節點
降低硬體門檻的方式 模型 CPU offload 量化壓縮,加上文字編碼器放系統記憶體
內容過濾 官方模型卡沒有特別說明 頁面標示沒有內建安全檢查器或內容過濾器
授權 Qwen Research License 同樣標示 Qwen Research License
適合誰 想先確認官方效果、習慣用程式環境的人 顯示卡吃緊、已經在用 ComfyUI 的人

我的建議很簡單。第一次接觸的話,先用官方 Demo 確認它的畫風、去背和中文字表現符不符合你的需求。確定有用,再看你的硬體決定走官方 Diffusers 還是社群的 GGUF。畢竟下載十幾 GB 的檔案之後才發現不合用,那種挫折感很難受。

使用沒有內建過濾的模型,要注意哪些事?

沒有內建過濾的模型,代表它不會替你把關,判斷與責任都落在使用者身上。模型頁面已經寫明,這個版本會依照提示詞直接生成,包含成人與敏感內容。這不代表你可以想生什麼就生什麼,法律規範、平台規則與他人的權利,都還是要自己顧好。

實際上有幾件事可以提早做。第一,別拿真人的肖像去生成會傷害對方的內容,也別侵犯他人的著作權。第二,如果要把成果放到網站或社群,先看該平台對 AI 生成內容的規範。第三,商用之前先讀過 Qwen Research License 的條款。

我自己的看法是,本機自由度高是這類工具最迷人的地方,但也是最容易踩線的地方。把它當成一把好用的工具,而不是免責金牌,日子會過得平順很多。如果你是要介紹給團隊或客戶用,也建議先把使用規則講清楚。

Qwen-Image-2.1 常見問題有哪些?

Qwen-Image-2.1 常見問題整理,是把大家最常卡住的差異比較、地區、繁體中文字與硬體問題集中回答。

Qwen-Image-2.1 和初代 Qwen-Image 差在哪裡?

初代 Qwen-Image 是 20B 參數的 MMDiT 模型,主打複雜文字渲染與精準圖片編輯。Qwen-Image-2.1 的視覺生成部分縮到 7B,並把生成與編輯整合在同一個模型,還新增原生透明圖片與最多 10 張參考圖的支援。簡單說,初代的重點放在文字,2.1 則偏向完整的視覺創作流程。

官方版和 GGUF 社群版差在哪裡?

官方版由 Qwen 發布,社群 GGUF 版則是第三方把官方權重轉成量化格式,方便在 ComfyUI 本機執行。GGUF 版標示沒有內建安全檢查器或內容過濾器,但並不是重新訓練過的模型。兩者授權都標示為 Qwen Research License,商用前請自行確認條款。

Qwen-Image-2.1 可以生成繁體中文字嗎?

官方目前沒有明確保證繁體或簡體中文字的表現。從第三方測試來看,短句、大字的成功率較有把握,長段落、小字與多行繁體則比較容易出錯。建議先用官方 Demo 拿你的繁體文案測試,正式使用前一定要逐字檢查。

台灣可以使用 Qwen-Image-2.1 嗎?有地區限制嗎?

我讀到的官方頁面沒有標註地區限制,模型權重公開在 Hugging Face 與 ModelScope,可以下載到自己的電腦執行。官方也提供 Hugging Face 上的 Demo,GitHub 另外提到 wuli.art 是給中國大陸使用者的免費入口。各平台的開放狀況可能隨時調整,實際請以官方頁面為準。

值得從現在的生圖工具換過來嗎?

如果你常常需要去背、透明素材或多張參考圖的編輯,值得花時間試試,因為它把這些工作放在同一個模型裡。如果你主要靠雲端服務出圖、沒有太多後製需求,就不必急著換。另外授權是 Qwen Research License,商用的人要先確認條款再決定。

顯示卡不夠強也能跑嗎?

有機會,但要看整套需求。官方建議使用 enable_model_cpu_offload 降低 VRAM 用量,社群 GGUF 版則透過量化與把文字編碼器放到系統記憶體來減輕負擔。要注意的是,Q4_K_M 雖然只有 4.6 GB,文字編碼器仍需要約 9.35 GB 到 17.53 GB 的空間,別只看擴散模型的大小。

所以 Qwen-Image-2.1 值得花時間試嗎?

Qwen-Image-2.1 值得試的地方,在於它把生圖、去背與修圖放進同一個開源模型,而不是再多一個只會出漂亮圖的模型。對內容創作者、電商賣家與設計師來說,透明背景與多參考圖是最有感的兩個功能。中文字的部分,官方沒有明說,就先當成需要自己驗證的功能。

至於社群的 GGUF 版,它讓更多人有機會在本機跑起來,但也把把關的責任交到使用者手上。先用官方版摸清楚需求,再決定要不要換成量化版,是我覺得比較穩的順序。如果你剛好想試,記得先把整套檔案的硬體需求算清楚。

最後留兩句給你:開源圖片模型的下一步,不是畫得更像照片,而是讓你少換幾個工具。官方沒有保證的地方,就該自己測過再拿去用。