想像一個很常見的場景:你要替小店做一張活動海報,得先用 AI 生一張圖,再找去背工具把主角摳出來,最後還要換另一個修圖工具,把手上多出來的東西擦掉。三個工具、三次匯出,每轉一手,畫質和耐心都會掉一點。Qwen-Image-2.1 想解決的,就是這種來回折騰。這次 Qwen 團隊把生圖、修圖和去背放進同一個開源模型,方向很明確。
🔔 不錯過任何精彩內容
立即訂閱我們的 LINE 或將本站設為 Google 偏好來源,掌握最新資訊!
根據官網的介紹(Qwen 官方部落格),Qwen-Image-2.1 把文生圖與圖片編輯整合在同一個模型裡,視覺生成部分只有 7B 參數,還原生支援透明圖片的生成與編輯。這篇文章會先整理官方公開的功能,再把很多人最在意的「圖片裡能不能生出繁體、簡體中文字」講清楚。最後加碼介紹社群釋出的 GGUF 版本,讓顯示卡沒那麼強的人,也有機會在自己的電腦上試試看。要先說一聲,中文字這一段,官方並沒有給出明確保證,我會把能查到的資料都攤開來。
Qwen-Image-2.1 是什麼?
Qwen-Image-2.1 是 Qwen 團隊在 2026 年 9 月 20 日開源的圖片模型,把文生圖與圖片編輯整合在同一個模型裡。官方模型卡說明,它的視覺生成部分是 7B 參數、32 層 Single-Stream DiT,目標是在畫質、推論效率與成本之間取得平衡。實際上,7B 對現在的開源圖片模型來說算是輕量,門檻比動輒更大的模型低一些。對一般玩家來說,這點比跑分好看更重要。
官方把這次更新歸納成四個方向:輕量高效、原生透明加上生成編輯一體化、支援最多 10 張參考圖的靈活編輯,還有更好的字體排版與人像質感。另外,模型用 Qwen3-VL 8B 同時讀懂文字指令和參考圖,再搭配一個支援透明度的 RGBA VAE。這些名詞看起來很硬,簡單講就是:它一次看得懂你的話,也看得懂你給的圖。
官方還提到,透過混合粒度注意力(Mixed-granularity Attention)與前綴 KV Cache 重複使用,多張圖片輸入時的效率提升特別明顯。白話一點,就是你丟進去的參考圖越多,它越不需要每一步都重新讀一遍。我的看法是,這種不炫技、但省時間的改動,最能看出團隊是想讓人天天用,而不是只拿來發新聞稿。
原生透明背景與照片去背有什麼用?
原生透明背景,是指模型直接生成帶有透明度資訊的 RGBA 圖片,不用事後再去背。過去 AI 生圖之後,只要想拿去做貼圖、簡報或商品圖,通常得再跑一次去背工具,邊緣還常常有毛邊。Qwen-Image-2.1 讓你在提示詞裡直接要求透明背景,出來的圖就是可以直接疊在別的畫面上的素材。這對做內容的人來說,省下的不只是時間,還有一堆邊緣修補的火氣。
官方建議的提示詞格式,是先寫「This is an RGBA image with transparency.」,接著放你的畫面描述,最後補上「The image has alpha channel and the background is transparent.」。官方範例是一張卡通小龍貼紙。除了生成,透明圖層也能繼續編輯,一般照片也能直接抽出指定主體,變成透明素材。
舉個例子,如果你經營一個小型電商,可以先請模型生出透明背景的商品圖示,直接放進自己的版型,或是拿一張實拍照抽出主體來去背。我的看法是,去背最能看出統一模型的價值:生成、抽取、修改都在同一個地方完成,圖層之間不用來回匯出。不過官方展示的畢竟是挑選過的範例,實際邊緣品質,還是要用你自己的圖去試。
多張參考圖與局部修改可以做到什麼程度?
多參考圖編輯,是讓模型同時參考多張素材圖,再依照你的文字指令組合成新畫面。官方說 Qwen-Image-2.1 最多支援 10 張參考圖,GitHub 上展示了兩個很直覺的例子:用六張個人肖像組成一張團體照,以及用模特兒、衣服、鞋子、包包與帽子共五張參考圖,組出完整穿搭。這種玩法很適合虛擬試穿、活動大合照,或需要固定角色的內容創作。想像你要替小品牌做型錄,過去得請人拍、修、合成,現在有機會先用這個方式做出概念稿。
局部修改則是另一個亮點。官方說明可以直接在圖上用圈選、塗抹標註,或另外提供一張 Mask,指定要改的位置。官方展示的例子是用圈選同時處理三件事:拿掉手錶、改變髮色、換掉衣服。官方也強調會保留人物與商品的辨識特徵,這對電商與人像類的用途特別重要。
官方 GitHub 還展示了兩種延伸用法:用一張自拍生成全景圖,以及從角色三視圖做出故事分鏡。這兩個範例看起來已經不只是修一張圖,而是在做視覺敘事的前置作業。對做角色設計、廣告分鏡或漫畫草稿的人來說,這是比較有想像空間的方向。不過分鏡的連貫程度,還是要看你實際丟多少參考圖、下什麼指令。
不過,有一位設計師在知乎發表了 13 組實驗、196 張圖的實測,除了稱讚中文排版、原生透明與多圖身份保持,也點出短板:「替換」有時會變成「新增」,而且編輯時整張圖可能被輕微重繪。這是個人測試,但正好提醒我們別把局部修改想成 Photoshop 的圖層蒙版。我的建議是,重要的圖改完之後,一定要拿原圖比對一次。
圖片裡的中文字(繁體、簡體)到底能不能生成?
圖片裡的中文字生成,指的是模型能不能在畫面中把你指定的漢字正確寫出來,而 Qwen-Image-2.1 官方目前沒有明確保證繁體或簡體。官方部落格提到,這次文字生成除了內容本身,也會考慮字體樣式、版面,以及它和整體構圖的關係。但我在官方部落格、GitHub 與模型卡的內容裡,都沒有看到明確寫出支援繁體中文或簡體中文。所以「能不能生中文字」的答案是:多半可以,但官方沒有背書。
初代 Qwen-Image 在 2025 年釋出時,官方明確主打中文字生成,並說在中文文字生成上明顯領先當時的模型。這讓大家對 2.1 期待很高,但要小心,那是上一代的說法,不能直接套用。下面把我查到的資料整理成表格,讓你看每個說法的來源和分量。
| 來源 | 測試對象 | 中文字相關說法 | 參考價值 |
|---|---|---|---|
| Qwen 官方(2.1) | Qwen-Image-2.1 | 只說文字生成會兼顧字體、版面與構圖,沒有明確寫支援繁體或簡體 | 最權威,但沒有給中文保證 |
| Qwen 官方(初代,2025 年) | 初代 Qwen-Image | 明確主打中文字生成,並稱明顯領先當時的模型 | 只能參考,不能直接套到 2.1 |
| 知乎設計師實測 | Qwen-Image-2.1(196 張圖) | 認為中文排版是明顯的強項 | 個人測試,語境偏簡體 |
| 六張本機樣本觀察 | Qwen-Image-2.1(社群 4-bit 權重) | 短中文字可辨,較大的字也能正確呈現 | 樣本太少,作者自己也強調不能一般化 |
| 數位時代實測 | 初代 Qwen-Image | 單行繁體能生成但有錯字,多行繁體仍不足 | 對象是初代,但屬於繁體實測 |
從表格來看,短句、大字的中文成功率比較有把握,這點有幾個獨立來源可以互相印證。至於繁體,目前只有初代的實測和零星樣本,大致的結論是單行多半能過關,多行長文還是容易出錯。簡體的資料比較多,我猜主要是因為測試者的語境不同,不代表模型真的偏愛簡體。商業用途我會更保守:畫面交給模型,文字自己用設計軟體疊上去。
如果你打算用它做含中文的海報或封面,有幾個做法可以降低翻車機率。第一,把要出現的文字用引號清楚寫在提示詞裡,字數盡量短。第二,一次只放一兩行,避開小字與長段落。第三,出圖後一定要逐字檢查,尤其是筆畫多的字和繁體字形。最保險的方式,是直接用官方 Demo 拿你自己的繁體文案測一輪,再決定要不要用它出正式稿。
Qwen-Image-2.1 怎麼開始用?
Qwen-Image-2.1 的使用方式有兩條路:直接開官方 Demo 體驗,或是把開源權重載到自己的電腦上跑。官方模型卡附有 Hugging Face 的 官方 Demo,不用安裝任何東西就能先測提示詞與效果。想確認繁體中文字表現的人,我建議先從這裡開始。要在自己的電腦跑的話,官方範例是以 NVIDIA 顯示卡(CUDA)示範,需要照著步驟準備環境。
第一步,安裝環境。官方需求是 PyTorch 2.4.0 以上、Transformers 5.17 以上、從 GitHub 安裝的最新版 Diffusers,再加上 accelerate 與 pillow。這裡要注意 Transformers 的版本比較新,舊環境可能要先升級。
第二步,載入模型。用 Diffusers 的 QwenImage21Pipeline 載入 Qwen/Qwen-Image-2.1,官方範例使用 bfloat16 精度。文生圖預設是 40 個推論步數、2048 x 2048 的解析度,官方說這款原生支援 2K。
第三步,選擇圖片比例。官方建議直接從下表挑尺寸,不要隨便改寬高,以免影響構圖與顯示記憶體用量。
| 比例 | 官方建議尺寸 | 我的用途建議 |
|---|---|---|
| 1:1 | 2048 x 2048 | 社群貼文、頭像、貼圖 |
| 4:3 | 2400 x 1792 | 簡報配圖、部落格內文圖 |
| 3:4 | 1792 x 2400 | 直式海報、商品圖 |
| 3:2 | 2528 x 1696 | 相片風格的橫式構圖 |
| 2:3 | 1696 x 2528 | 人像、直式封面 |
| 16:9 | 2752 x 1536 | 網站橫幅、影片封面 |
| 9:16 | 1536 x 2752 | 短影音封面、手機直式圖 |
第四步,編輯圖片。把原圖傳給 pipeline 就能做單張編輯,多張參考圖則傳入圖片清單。要做透明圖,記得使用前面提到的官方提示詞格式。如果想讓短提示詞更穩,官方另外提供 Qwen-Image-2.1-PE-T2I 與 Qwen-Image-2.1-PE-I2I 兩個提示詞改寫模型。有社群測試者的比較就認為,沒有使用官方提示詞改寫器,是實測和宣傳落差的最大來源。
第五步,處理 VRAM 不足。官方的建議是啟用 enable_model_cpu_offload,讓部分模型暫時放到 CPU 端,代價是速度通常會慢一些。另外 ComfyUI 從第一天就原生支援,也提供文生圖與圖片編輯的範例工作流程。授權方面,模型採用 Qwen Research License,要商用的人,請先自己讀過條款。
社群 Qwen-Image-2.1 Uncensored GGUF 是什麼?
Qwen-Image-2.1 Uncensored GGUF 是社群成員把官方 Qwen-Image-2.1 權重轉成 GGUF 量化格式的版本,方便在 ComfyUI 本機執行。這個版本放在 Hugging Face 的社群模型頁面上,由帳號 abenzerps 發布,並不是 Qwen 官方推出的。模型頁面寫明,它是用原始上游權重做的量化,來源模型就是 Qwen/Qwen-Image-2.1。所以它的能力來自官方模型,只是換成比較容易載入、也壓縮過的檔案格式。
這裡的「無內建過濾」要這樣理解:模型頁面說明這個版本沒有內建安全檢查器或內容過濾器,會依照提示詞直接生成,包含成人與敏感內容,不會拒絕或輸出黑圖。換句話說,它指的是沒有附帶把關機制,並不是模型被重新訓練,也不是多了什麼特別的能力。輸出會變成什麼樣子,取決於你的提示詞與執行環境。
這個版本同樣採用 Qwen Research License,頁面上也附有檔案校驗碼(SHA256SUMS),下載後可以自己核對。我的看法是,第三方轉檔最需要注意的是來源與版本,畢竟你信任的是那位轉檔者,而不是 Qwen 官方。所以如果沒有一定要用,先從官方版開始會比較踏實。
GGUF 版要選哪個量化檔案?
量化檔案,是把模型壓縮成較小的體積,用一點畫質換取更低的硬體門檻。這個 Hugging Face 頁面一口氣列出很多版本,容易讓人眼花。頁面推薦的是 Q4_K_M,理由是檔案大小與畫質之間的折衷比較好。下表整理的是頁面列出的 Uncensored 版本。
| 版本 | 檔案大小 | 檔案格式 | 我的建議 |
|---|---|---|---|
| BF16 | 14.23 GB | gguf | VRAM 夠大、想要最接近原版的人 |
| Q8_0 | 7.59 GB | gguf | 想接近原版、又想小一點的人 |
| Q6_K | 5.88 GB | gguf | 畫質與大小的中間選項 |
| Q5_K_M | 5.22 GB | gguf | Q4_K_M 不夠用時的升級選項 |
| Q4_K_M | 4.60 GB | gguf | 頁面推薦,多數人先從這個開始 |
| Q4_0 | 4.15 GB | gguf | 最小的 GGUF 選項,一般來說位元越低越吃畫質 |
| FP8 | 6.63 GB | safetensors | 不是 GGUF 格式,載入方式不同,要留意 |
| INT8 ConvRot | 6.76 GB | safetensors | 同樣不是 GGUF 格式 |
| NVFP4 | 4.20 GB | safetensors | 同樣不是 GGUF 格式 |
| MLX 4-bit、6-bit、8-bit | 4.00 GB、5.78 GB、7.56 GB | safetensors | 給 Apple 平台使用的版本 |
要提醒的是,檔案大小不等於整套流程需要的記憶體。除了擴散模型,還要搭配文字編碼器與 VAE:BF16 的文字編碼器約 17.53 GB,INT8 版約 9.35 GB,VAE 約 676 MB。頁面建議的配置是 Q4_K_M 加上 INT8 文字編碼器,把擴散模型放在 GPU 的 VRAM,文字編碼器放在系統記憶體。因為文字編碼每個提示詞只跑一次,頁面說這樣可省下 9 到 17 GB 的 VRAM,對生成速度幾乎沒有影響。
我覺得這是最容易被誤會的地方。很多人看到 4.6 GB 就以為 8 GB 顯示卡輕鬆搞定,實際上你還得準備約 9 GB 以上的系統記憶體給編碼器,再留一些空間給 ComfyUI 與生成過程。買硬體或下載檔案之前,先把整套加起來算一遍,會少走很多冤枉路。
GGUF 版怎麼在 ComfyUI 上跑?
在 ComfyUI 跑 GGUF 版,要先下載三種檔案,再裝上支援 Qwen-Image 2.1 的 GGUF 節點。整個流程不算難,但步驟有點多,卡關的地方通常是節點版本。我把頁面上的做法整理成六個步驟,照著做就行。
第一步,下載檔案。擴散模型選一個 GGUF,頁面推薦 Q4_K_M,文字編碼器選 qwen3vl_8b_int8_convrot 或 qwen3vl_8b_bf16,另外下載 qwen_image_2.1_vae_bf16 這個 VAE。檔案都放在同一個 Hugging Face 倉庫裡,不用到處找。
第二步,放對資料夾。擴散模型放進 ComfyUI/models/diffusion_models,文字編碼器放進 ComfyUI/models/text_encoders,VAE 放進 ComfyUI/models/vae。放錯位置的話,節點裡就選不到檔案。
第三步,安裝 GGUF 節點。頁面建議使用 leejet 維護的 ComfyUI-GGUF 分支,到 ComfyUI/custom_nodes 資料夾裡,用 git clone 下載它。如果你之前裝的是舊版 city96 分支,遇到 Unknown model architecture 的錯誤,就換成這個分支。裝完之後,記得重新啟動 ComfyUI。
第四步,設定節點。擴散模型用「Unet Loader (GGUF)」載入,文字編碼器用一般的「CLIPLoader」,type 要設成 qwen_image,VAE 則用「VAELoader」。這三個載入節點缺一不可。
第五步,套用官方範本。Comfy-Org 提供了文生圖與圖片編輯兩個工作流程範本,載入後把預設的 UNETLoader 換成「Unet Loader (GGUF)」就能開始。這樣就不用自己從空白畫布接線。第一次建議先跑範本的預設設定,確認能出圖再調參數。
第六步,處理 VRAM 不足。如果出現記憶體不足的錯誤,頁面建議用 --lowvram 參數啟動 ComfyUI。同時保持擴散模型在 GPU、文字編碼器放在系統記憶體的配置,通常就能省下不少空間。
官方版和 GGUF 社群版該選哪個?
官方版與 GGUF 社群版的差別,在於發布者、檔案格式與硬體門檻,能力則同樣來自 Qwen-Image-2.1。這樣說有點抽象,我直接放成表格,你可以對著自己的電腦挑。挑選的關鍵其實不是誰比較強,而是你現在手邊有什麼設備。
| 比較項目 | 官方 Qwen-Image-2.1 | 社群 Uncensored GGUF |
|---|---|---|
| 發布者 | Qwen 官方 | 社群帳號 abenzerps |
| 主要檔案格式 | safetensors(BF16) | 以 GGUF 為主,另有 FP8、INT8、NVFP4、MLX |
| 主要使用工具 | Diffusers、ComfyUI、vLLM-Omni、SGLang 等 | ComfyUI 加上 ComfyUI-GGUF 節點 |
| 降低硬體門檻的方式 | 模型 CPU offload | 量化壓縮,加上文字編碼器放系統記憶體 |
| 內容過濾 | 官方模型卡沒有特別說明 | 頁面標示沒有內建安全檢查器或內容過濾器 |
| 授權 | Qwen Research License | 同樣標示 Qwen Research License |
| 適合誰 | 想先確認官方效果、習慣用程式環境的人 | 顯示卡吃緊、已經在用 ComfyUI 的人 |
我的建議很簡單。第一次接觸的話,先用官方 Demo 確認它的畫風、去背和中文字表現符不符合你的需求。確定有用,再看你的硬體決定走官方 Diffusers 還是社群的 GGUF。畢竟下載十幾 GB 的檔案之後才發現不合用,那種挫折感很難受。
使用沒有內建過濾的模型,要注意哪些事?
沒有內建過濾的模型,代表它不會替你把關,判斷與責任都落在使用者身上。模型頁面已經寫明,這個版本會依照提示詞直接生成,包含成人與敏感內容。這不代表你可以想生什麼就生什麼,法律規範、平台規則與他人的權利,都還是要自己顧好。
實際上有幾件事可以提早做。第一,別拿真人的肖像去生成會傷害對方的內容,也別侵犯他人的著作權。第二,如果要把成果放到網站或社群,先看該平台對 AI 生成內容的規範。第三,商用之前先讀過 Qwen Research License 的條款。
我自己的看法是,本機自由度高是這類工具最迷人的地方,但也是最容易踩線的地方。把它當成一把好用的工具,而不是免責金牌,日子會過得平順很多。如果你是要介紹給團隊或客戶用,也建議先把使用規則講清楚。
Qwen-Image-2.1 常見問題有哪些?
Qwen-Image-2.1 常見問題整理,是把大家最常卡住的差異比較、地區、繁體中文字與硬體問題集中回答。
Qwen-Image-2.1 和初代 Qwen-Image 差在哪裡?
初代 Qwen-Image 是 20B 參數的 MMDiT 模型,主打複雜文字渲染與精準圖片編輯。Qwen-Image-2.1 的視覺生成部分縮到 7B,並把生成與編輯整合在同一個模型,還新增原生透明圖片與最多 10 張參考圖的支援。簡單說,初代的重點放在文字,2.1 則偏向完整的視覺創作流程。
官方版和 GGUF 社群版差在哪裡?
官方版由 Qwen 發布,社群 GGUF 版則是第三方把官方權重轉成量化格式,方便在 ComfyUI 本機執行。GGUF 版標示沒有內建安全檢查器或內容過濾器,但並不是重新訓練過的模型。兩者授權都標示為 Qwen Research License,商用前請自行確認條款。
Qwen-Image-2.1 可以生成繁體中文字嗎?
官方目前沒有明確保證繁體或簡體中文字的表現。從第三方測試來看,短句、大字的成功率較有把握,長段落、小字與多行繁體則比較容易出錯。建議先用官方 Demo 拿你的繁體文案測試,正式使用前一定要逐字檢查。
台灣可以使用 Qwen-Image-2.1 嗎?有地區限制嗎?
我讀到的官方頁面沒有標註地區限制,模型權重公開在 Hugging Face 與 ModelScope,可以下載到自己的電腦執行。官方也提供 Hugging Face 上的 Demo,GitHub 另外提到 wuli.art 是給中國大陸使用者的免費入口。各平台的開放狀況可能隨時調整,實際請以官方頁面為準。
值得從現在的生圖工具換過來嗎?
如果你常常需要去背、透明素材或多張參考圖的編輯,值得花時間試試,因為它把這些工作放在同一個模型裡。如果你主要靠雲端服務出圖、沒有太多後製需求,就不必急著換。另外授權是 Qwen Research License,商用的人要先確認條款再決定。
顯示卡不夠強也能跑嗎?
有機會,但要看整套需求。官方建議使用 enable_model_cpu_offload 降低 VRAM 用量,社群 GGUF 版則透過量化與把文字編碼器放到系統記憶體來減輕負擔。要注意的是,Q4_K_M 雖然只有 4.6 GB,文字編碼器仍需要約 9.35 GB 到 17.53 GB 的空間,別只看擴散模型的大小。
所以 Qwen-Image-2.1 值得花時間試嗎?
Qwen-Image-2.1 值得試的地方,在於它把生圖、去背與修圖放進同一個開源模型,而不是再多一個只會出漂亮圖的模型。對內容創作者、電商賣家與設計師來說,透明背景與多參考圖是最有感的兩個功能。中文字的部分,官方沒有明說,就先當成需要自己驗證的功能。
至於社群的 GGUF 版,它讓更多人有機會在本機跑起來,但也把把關的責任交到使用者手上。先用官方版摸清楚需求,再決定要不要換成量化版,是我覺得比較穩的順序。如果你剛好想試,記得先把整套檔案的硬體需求算清楚。
最後留兩句給你:開源圖片模型的下一步,不是畫得更像照片,而是讓你少換幾個工具。官方沒有保證的地方,就該自己測過再拿去用。