Qwen Image 2.1 提示词实战手册(2026):编辑、抠图与 ControlNet 玩法
Qwen Image 2.1 把文生图、图像编辑、透明抠图和多图参考合成塞进了一个 7B 模型——管线不再是门槛,提示词才是。本手册整理三支实测演示(Benji's AI Playground、ComfyUI Workflow Blog、Loop Forge)里的 16 条提示词配方:结构化改写、圈选与蒙版编辑、RGBA 抠图、参考图驱动的穿搭与软装,以及 ControlNet 姿势与深度进阶。模型还没跑起来的话,先看我们的[Qwen Image 2.1 本地部署教程](/guides/how-to-use-qwen-image-2-1)再回来。
来源与致谢
本教程的截图来自 Benji's AI Playground 的公开演示视频。每个步骤都链接到视频中的对应时间点,方便你对照学习。
Benji's AI Playground ↗Qwen Image 2.1 真正吃的提示词结构
- 1
从官方改写系统提示词起步
Qwen 团队随 prompt enhancer 模型附了一份系统提示词,Loop Forge 直接让编码助手读了这份「图像提示词改写专家」模板:把粗略想法改写成一段完整英文长段落,逐条固定你写明的颜色、位置、物体数量和画面文字,再附一条短提示词声明哪些内容必须原样保留。八步按顺序执行、后面的步骤不改前面的结论——借用这套纪律,比自由发挥靠谱。

官方改写系统提示词:一段话进,八个有序步骤,绝不回改。视频 4:35 处 - 2
格式化段落胜过千字小作文
Benji 测了一天后的结论:高质量输出不等于长篇大论。Qwen 官方系统提示词给模型留好了主体、风格、光线、文字内容各就各位的槽位,右侧这张剪纸风人物拼贴就出自一段结构化段落,而不是一堆形容词的堆叠。他自己写的 ComfyUI 节点会调用官方改写模型,帮你自动完成这套格式化。

结构对结构:格式槽位比形容词堆砌更有用。视频 5:00 处 - 3
先算分辨率账,再写提示词
Loop Forge 的耗时表把「编辑税」写得很直白:100 万像素出图 52 秒、编辑 78 秒;到 200 万像素编辑要花 2.45 倍于生成的时间。模型快到 Benji 直接把默认 25 步拉到 50 步——这个速度下步数是质量旋钮,不是等待问题。顺带看清角落小字:许可证已换成 Qwen Research,不再是 Apache 2.0。

编辑耗时约为生成的 1.5 至 2.7 倍,写提示词前先看分辨率档位。视频 5:05 处
文字与图表渲染:提示词管创意,数字手动修
- 4
文字清晰可读的活动海报
2.1 版的英文和中文文字渲染比上一代干净得多,活动海报和样机图变成一句提示词的事。这张 Northern Lights 田野录音海报的标题、日期栏、场地地址和 NL 圆标一轮生成全部可读——诀窍是按区块描述版式(标题、信息框、页脚行),让模型自己排字。

标题、日期框、页脚行一轮生成全部清晰可读。视频 4:20 处 - 5
带图解的白板讲解图
概念图板是甜点区:这张「经典 vs 量子」白板画了灯泡与轨道草图、布洛赫球、线路记号,还配了叠加与纠缠的要点列表。这个规模下拼写基本正常,幻灯片式讲解图属于安全的提示词族——模型负责传达想法,不负责记账。

想法级图解扛得住;Benji 跑了 50 步让线条更干净。视频 7:55 处 - 6
蓝图:版式能用,数字重做
一旦观众会验算,同族提示词就露馅。这张分区图版式全对——住宅、商业、工业色带配图例——但标注的尺寸经不起细读。任何带测量数字的图,都把渲染结果当草稿:重新生成拿版式,真数字进编辑器手填。

版式可信,尺寸瞎编——观众可能验算的图必须人工复核。视频 9:10 处
编辑工作流:圈选、蒙版与 RGBA 抠图
- 7
先圈住物体,再只说它的变化
局部编辑是本代招牌:圈住画面里的区域,只描述这一处的变化——这里的沙滩冰桶被指令「嵌进沙子里」,画面其余部分纹丝不动。Loop Forge 的两条纪律:选区和句子必须指向同一处;圈要画大一点,曾有太小的圈没圈住叶子,结果模型长出了新叶子而不是改旧叶子。

圈一个物体,写一句它的话——画面其余部分全部冻结。视频 2:40 处 - 8
用 Image 1、Image 2 标签换装
Qwen 文档定义了多图编辑的「Image 1, Image 2」标签写法,换装是标准用法:指认一张图里的连衣裙、另一张图里的外套,让模型给人物换装,同时保留 Image 1 的脸、发型、姿势和背景。回报是纺织品质保真——上身效果的碎花印花和平铺布料逐针对应。

上身图复刻了平铺图的印花——参考标签的价值就在纹理保真。视频 6:15 处 - 9
圈选不够用时,画蒙版
要外科手术级的控制,ControlNet 应用节点接受独立的 inpaint 图像和蒙版输入:打开蒙版编辑器,精确涂出要重绘的区域——这里是这只衣袖——原照片作为底图输入。编辑区边界硬、或旁边有经不起重采样的细节时,蒙版比圈选稳。

涂蒙版、锁底图:只有衣袖会被重采样。视频 8:15 处 - 10
把负向提示词写成验收标准
配合蒙版的局部重绘提示词是一对。正向:Image 1 仅作身份与外观参考,保持同一位女性,把红色皮夹克换成合身黑色 T 恤。负向:身份漂移、服装颜色变化、手部畸形、多出手指、水印。把你拒绝的失败模式一条条列出来,编辑才不会跑偏。

正向写要什么,负向列怕什么。视频 9:15 处 - 11
要「新建透明图」,不要「去掉背景」
透明通道是原生能力——去年 12 月的 Layered 模型已并入 2.1,不需要独立的抠图节点和蒙版流程。Loop Forge 的排错笔记比功能本身更值钱:让模型「从这张图里去掉背景」抠出来满是噪点,改成「新建一张该物体的透明图」就干净了。同一招还能产出整版 RGBA 素材表,比如这张八件套手绘物件平铺。

措辞就是修法:说「新建透明图」,alpha 通道就干净。视频 1:40 处
多图参考提示词:穿搭、软装与角色一致性
- 12
最多十张参考图,拼出一套穿搭
编辑最多接受 10 张参考图,电商演示是最直观的用法:裤子、格子衬衫、墨镜各来一张图,一句提示词让人物全套上身。不是每件衣服都完美——Benji 的背带裤回来时两条背带被「一本正经」地没有穿进扣环——上商品页前留一轮人工复核。

三张商品图进,一套穿搭出——留一眼复核怪细节。视频 11:40 处 - 13
在提示词里给每张图分工
室内软装演示了参考语法最明确的写法:Image 1 声明为「空客厅、目标区」,之后每张图写明从它取什么——沙发、茶几、电视墙。填好的房间布局与光线连贯,但模型自己承认没有空间尺度,家具尺寸当参考看,下单前自己量。

每张参考图标明角色——目标区在前,素材图在后。视频 12:55 处 - 14
角色转面表解锁镜头运动
角色转面表(turnaround sheet)是一致性工具:把多角度表和场景一起喂给模型,它就能让同一个角色换机位——Benji 把酒店房间镜头转到了房间另一侧,单张正面照做不到,因为模型根本不知道后脑勺长什么样。同一类转面表还能喂分镜和视频模型的首帧。

把后脑勺喂给模型,它就敢从背后拍。视频 15:25 处
ControlNet 进阶:姿势与深度的提示词配合
- 15
姿势迁移:先同尺寸,再降强度
ControlNet 附件是一个 7.55 GB 的单文件,覆盖八种控制类型——pose、depth、canny、HED、lineart、MLSD、scribble、grayscale——外加局部重绘支持。姿势迁移的修法很机械:先把源图和控制图缩放到同一分辨率。难姿势还把手画崩,就用文字描述姿势并把强度从 1.0 降到 0.8,让模型在句子和骨架之间偏向句子。

同尺寸输入加 0.8 强度,把崩坏的姿势迁移修干净。视频 4:40 处 - 16
深度控制:换材质不挪家具
深度控制锁住几何,其余全归提示词。验证过的模板:保留控制结构里的相机位置、房间透视、天花板高度、窗户与家具摆放,然后替换材质——深色石材、烟熏玻璃、哑光黄铜、深色实木——再加暖色间接光和窗外夜景。白天变黑夜,每盏灯都在原位。人物用 DW pose,房间用 Depth Anything V2 预处理器。

几何交给深度图,材质和光线交给句子。视频 7:00 处

