Qwen Image 2.1 使用指南:2026 年 ComfyUI 全流程实战
Qwen-Image 2.1 是阿里在 2026 年 9 月 20 日放出的开源图像模型:单个 7B 网络同时负责生图与修图,原生输出透明 PNG,一次最多参考 10 张图,分辨率最高到 2K。这份 16 步教程跟着一支完整的 ComfyUI 实操视频,从下载模型文件一路走到透明抠图、角色参考表和多机位一致性。
来源与致谢
本教程的截图来自 ComfyUI Workflow Blog 的公开演示视频。每个步骤都链接到视频中的对应时间点,方便你对照学习。
ComfyUI Workflow Blog ↗认识 Qwen-Image 2.1:阿里开源的 7B 图像模型
- 1
认识 Qwen-Image 2.1:生图修图一体的 7B 开源模型
Qwen-Image 2.1 由阿里在 2026 年 9 月 20 日发布,把文生图和图像编辑装进同一个 7B 模型(32 层单流 DiT 架构)。它天生会画透明图,一次最多参考 10 张照片,分辨率最高到原生 2K。可以先在 Hugging Face 官方 Demo 里免费试,再按本教程把它跑在本地 ComfyUI 里。

发布海报上的这些亮点,正是本教程要逐个过一遍的内容。视频 0:20 处 - 2
下载 ComfyUI 需要的三个模型文件
ComfyUI 要三样东西:图像模型二选一,INT8 约 7.3 GB 更省显存,BF16 约 14.2 GB 是完整精度;再加 Qwen3-VL-8B 文本编码器(约 9.4 GB)和 Qwen-Image 2.1 的 VAE(约 676 MB)。显存紧张选 INT8,追求质量选 BF16。下载后按类别放进 ComfyUI 的 models 子目录。

两个版本的模型、一个编码器、一个 VAE,下载清单就这么短。视频 0:40 处 - 3
把三个加载节点连起来
先把 ComfyUI 更新到新版,才会出现 Qwen-Image 2.1 专用的文本编码节点和官方工作流模板。在图里,Load Diffusion Model 指向你的 qwen_image_2.1 模型文件,Load CLIP 载入 Qwen3-VL-8B,Load VAE 选 2.1 的 VAE。三个加载器都接进采样器后,文生图管线就通了。

一个加载节点对应一个下载文件,图和模型目录一一对应。视频 1:30 处
在 ComfyUI 里生成你的第一批图
- 4
从 25 步、CFG 1、Euler 起步
官方模板的起点是 25 步、CFG 1,采样器 Euler、调度器 simple。注意 CFG 1 会完全跳过负面提示词,“不要文字、不要水印”这类要求要直接写进主提示词。教程作者的 BF16 模型在 RTX 5090 上一张图只要 10 秒左右。

这些就是模板默认值,之后每次只动一个旋钮。视频 1:45 处 - 5
跑出第一张文生图
在 Qwen-Image 2.1 文本编码节点里写好描述,排队运行。教程的第一张人像测试:皮肤质感真实、耳环画对、完全没有塑料感。接下来改提示词时把随机种子固定住,一次只动一句话,这样画面的每处变化都来自你改的那句词,方便归因。

一张简单人像,就是检验安装是否成功的最快方式。视频 2:01 处 - 6
按七个槽位写提示词
教程的提示词速查表按顺序填七个槽位:主体、构图、环境、光照、细节、输出目标、排除项。CFG 1 不读负面提示词,排除项要写成正文里的“无文字、无标志、无多余物体”。视频里同一构思的随手写法和结构化写法各跑一次,差距一目了然。

把槽位填满,就不再靠运气反复抽卡。视频 4:40 处 - 7
手画错了?先提高分辨率
杯子、脚这类细节崩了,作者的第一招是提分辨率:把 Resolution Selector 从 2 百万像素往 4 百万调。工作流里的备注列出了各宽高比的精确像素,比如 16:9 对应 2752x1536。分辨率越高耗时越长,建议小尺寸打草稿,构图定了再放大出图。

测试里多数肢体翻车,都是提高百万像素后消失的。视频 4:00 处 - 8
步数拉到 40,脸部更细
官方 ComfyUI 模板默认 25 步,但模型开发者自己的示例用的是 40 步——教程实测 40 步的脸部细节肉眼可见地变多。代价是时间随步数上涨,高分辨率时更明显。出带小字的电影感海报时,多出来的步数也让字母笔画更稳、更少糊边。

同样工作流,40 步之后脸和小字都更扎实。视频 6:53 处
修图、抠图与角色一致性
- 9
想要透明 PNG,开头写 RGBA
透明是原生能力:编辑提示词开头写 “This is an RGBA image with transparency”,再描述要抠的主体。结果一定存成 PNG,JPEG 会丢掉 alpha 通道。测试者提醒边缘 alpha 可能略有噪点,商用素材记得再清理一次。

一句话顶一个抠图软件。视频 11:14 处 - 10
不只抠背景,任何物体都能抠
同一招可以只抠道具:要剑,模型就把剑从画面里单独剥出来,背景和持剑人都不要。抠出来后发现剑刃缺了一截,还能继续让它补全细节——教程里就是这么把断刃补完整的。贴纸、商品图、游戏道具素材,都能按这个路子做。

说出物体名字,剩下的画面模型自己处理。视频 11:45 处 - 11
给参考图编号:image one、image two
编辑工作流里每张上传的图都有口头编号——“image one”“image two”,指令里直接引用这些编号。一次只改一处,并写明什么不能动:“保持脸、发型、姿势和背景不变”。这些句子用任何 AI 聊天工具都能起草,不需要特殊节点。

编号写清楚,模型才知道哪张图负责哪个部分。视频 13:45 处 - 12
一次合成最多 10 张参考图
多加几个图片加载节点,Qwen-Image 2.1 就能在一次生成里融合它们:演示里大衣取自第三张图,短裤和鞋取自第二张,人物取自第一张。姿势、脸和场景都保持原样,花纹也对得上原图。电商虚拟试穿、穿搭展示用的就是同一套机制。

三张参考图一次出图,人物身份没有跑偏。视频 14:27 处 - 13
一张照片长出角色参考表
上传角色照片,提示词写:“Create a character reference sheet... front, side, and back views... side by side on a plain background”教程结果里同一个动漫角色五个角度全程一致,可以直接当视频模型的参考帧。想加特写或更多角度,多写一句话就行。

一张照片进,整套转面图出,不用手动对齐。视频 8:10 处
参数技巧、局限与许可证
- 14
同一场景换八个机位重拍
把所有角度塞进一张图里生成会翻车——杯子在不同视角换了边。改成一次只生成一个角度,八张图里的人物、红色罐子和湿漉漉的街道全都对得上,墙面位置这类小细节偶有出入,整体已经够用。这组静帧正好可以喂给图生视频模型当首帧,省掉重新布景的功夫。

八次提示词,一个不变的世界,红罐子每帧都在。视频 15:00 处 - 15
用官方 PE 模型自动扩写提示词
Qwen 官方提供了提示词增强模型 Qwen-Image-2.1-PE,分文生图用的 T2I 和编辑用的 I2I 两个版本,在官方 Hugging Face 仓库免费下载。接一个文本模型节点,五个词的粗略想法就能自动扩成完整的结构化提示词。不想用,ComfyUI 里接一个普通 LLM 节点效果类似。

增强模型是可选项,七槽位手写提示词一样能用。视频 6:03 处 - 16
商用之前先看许可证
Qwen-Image 2.1 采用 Qwen Research License:学习、实验、个人项目没问题,商用需要向 Qwen 团队单独授权(初代 Qwen-Image 是 Apache 2.0,2.1 不是)。教程作者的结论:这是他测过的最强开源图像模型之一,皮肤质感比 ChatGPT 的图更真实,不过精细文字仍是 ChatGPT 更强。接单前先确认许可证。

学习免费随便玩,商用前务必核对许可证。视频 15:45 处

