这两天打开 B 站、推特,满屏都是 Qwen-Image 2.1。说实话一开始我没太当回事,毕竟隔三差五就有新模型出来”吊打”谁谁谁。结果点进去一看参数,卧槽,7B?上一代 Qwen-Image 可是 20B 的大家伙,我那会儿想本地跑一下,光一个 BF16 的模型就 40.9GB,看了一眼硬盘和显卡就默默关掉了。
这次不一样了。新版视觉生成器只有 7B,BF16 是 14.2GB,INT8 版本只有 7.26GB,甚至有人搞出了一套只占 3.05GiB 显存就能出图的配置。这我还忍得住?
于是就有了这篇文章,记录一下在 ComfyUI 里把 Qwen-Image 2.1 跑起来的全过程,踩的坑也一起写上。话不多说,直接开干!

先简单说下它强在哪
就挑几个我觉得最实用的说:
它把生图和改图合成了一个模型,写提示词就出图,丢一张图加一句指令就能改图,以前这俩是分开的模型。原生 2K 出图,最高能到 2752×2752。
最香的是透明背景。它直接输出带 Alpha 通道的 RGBA 图,不用再额外抠图,做图标、Logo、产品抠图这种活出来就能直接用。改图的时候一次最多能喂 10 张参考图,文字渲染也还是 Qwen 家一贯的强项。

丑话说在前面:许可证
这个一定要看。跟之前开源的 Qwen 图像模型都不一样,这次是仅限研究用途,商用要另外找阿里签协议。自己玩、学习、测试随便用,但要是拿去做商品图、广告图,先把授权搞清楚再说,别到时候踩雷。
安装或更新 ComfyUI
还没装 ComfyUI 的,直接去官网下桌面版,一步一步点下一步就好了,无脑操作:Download Comfy Desktop
已经装过的,一定要更新到最新版,Qwen-Image 2.1 是原生支持的,老版本会出现节点缺失、找不到模板的情况。桌面版在软件里点更新就行;Windows 便携包跑一下 update 文件夹里的 update_comfyui.bat;自己 git 装的:
cd ComfyUI
git pull
pip install -r requirements.txt
Download Comfy Desktop – Run AI on Your Hardware 直接官网下一步下一步就好了无脑操作

第二步:下载模型
我用的是 Comfy 官方重打包的版本:https://huggingface.co/Comfy-Org/Qwen-Image-2.1
这是专门给 ComfyUI 重新打包好的模型文件,原始模型仓库是 Qwen/Qwen-Image-2.1。直接下这个就行,不用自己折腾格式。
点进 Files and versions,一共三个文件夹,按自己显卡挑着下:
diffusion_models(主模型,二选一)
qwen_image_2.1_bf16.safetensors:原版精度,显存大的上这个qwen_image_2.1_int8_convrot.safetensors:体积砍一半,大部分人选这个就够了

text_encoders(文本编码器,三选一)
qwen3vl_8b_bf16.safetensorsqwen3vl_8b_int8_convrot.safetensorsqwen3vl_8b_w4a8.safetensors(最省显存)

vae(必下)
qwen_image_2.1_vae_bf16.safetensors

text_encoders 里还有两个 qwen3.5_9b_qwen_image_2.1_pe_... 开头的文件,每个 9GB 多。这俩是提示词增强模型,要配合 TextGenerate 节点用。t2i 是文生图用的,i2i 是改图用的。说白了就是帮你把一句简单的描述扩写成详细的提示词,不下也能正常出图,硬盘紧张的先跳过。
国内下 Hugging Face 慢的话,挂个镜像或者用下载工具多线程拉。
第三步:文件放对位置
按这个结构放,以 int8 为例:
ComfyUI/
└── models/
├── diffusion_models/
│ └── qwen_image_2.1_int8_convrot.safetensors
├── text_encoders/
│ └── qwen3vl_8b_int8_convrot.safetensors
└── vae/
└── qwen_image_2.1_vae_bf16.safetensors
对应关系:
qwen_image_2.1_int8_convrot.safetensors → ComfyUI_windows_portable\ComfyUI\models\diffusion_models\
qwen3vl_8b_int8_convrot.safetensors → ComfyUI_windows_portable\ComfyUI\models\text_encoders\
qwen_image_2.1_vae_bf16.safetensors → ComfyUI_windows_portable\ComfyUI\models\vae\
如果下了提示词增强模型,也一起丢进 text_encoders。放完记得重启 ComfyUI,不然下拉框里刷不出来。
第四步:加载工作流开跑
仓库页面上直接给了三个现成工作流,比我预想的还多一个:
- 文生图:
image_qwen_image_2_1_t2i.json - 图片编辑:
image_qwen_image_2_1_image_edit.json - 一键抠图:
image_qwen_image_2_1_background_removal.json
文生图工作流
图像编辑(图生图)
image_qwen_image_2_1_image_edit.json
一键抠图
image_qwen_image_2_1_background_removal.json
这三个工作流我也打包放在文章底部了,包括我自己使用的版本,懒得去 GitHub 的直接下。
都在 Comfy-Org 的 workflow_templates 仓库里,下载 JSON 拖进 ComfyUI 就能用。更新到最新的 ComfyUI 也可以直接在模板库里搜 “Qwen Image 2.1″,搜不到就说明版本不够新,回第一步。
打开工作流后检查三个加载节点:Load Diffusion Model 选主模型,Load CLIP 选文本编码器,Load VAE 选 VAE。然后在提示词框里写你想要的东西,Ctrl + Enter 跑起来。
想出透明背景的图,提示词里写明要透明背景就行。已经有现成图片想抠的,直接用第三个抠图工作流,丢图进去就出透明底,这个对做产品图的来说是真省事。

显存不够怎么办
1. 换小一档的文件。 主模型用 int8,文本编码器用 w4a8,这是官方仓库里最省显存的组合,先试这个。
2. 加启动参数 --lowvram,慢一点但基本都能跑起来。
3. 提示词增强模型先别加载。 那俩 9GB 多的文件很吃资源,显存本来就紧张的话,基础出图跑通了再说。
踩坑汇总
模板找不到: 十有八九是 ComfyUI 版本太旧,更新完再搜。
加载节点下拉框是空的: 文件放错文件夹了,或者放完没重启。
名字别搞混: 官方名字就叫 Qwen-Image-2.1,网上有人说的 2509、2512 是老版本,下载的时候认准 Comfy-Org/Qwen-Image-2.1 这个仓库。
整体跑下来,这次 Qwen 是真的把门槛打下来了,以前得租云端 GPU 才能玩的东西,现在家里的显卡就能搞定。透明背景和一键抠图对做电商图、做素材的来说太实用了,就是许可证收紧有点可惜。大家有啥问题评论区见,我踩到新坑会继续更新。
参考链接
Comfy-Org/workflow_templates: ComfyUI template workflows

