Qwen Image 2.1 提示词实战手册(2026):编辑、抠图与 ControlNet 玩法

Qwen Image 2.1 把文生图、图像编辑、透明抠图和多图参考合成塞进了一个 7B 模型——管线不再是门槛,提示词才是。本手册整理三支实测演示(Benji's AI Playground、ComfyUI Workflow Blog、Loop Forge)里的 16 条提示词配方:结构化改写、圈选与蒙版编辑、RGBA 抠图、参考图驱动的穿搭与软装,以及 ControlNet 姿势与深度进阶。模型还没跑起来的话,先看我们的[Qwen Image 2.1 本地部署教程](/guides/how-to-use-qwen-image-2-1)再回来。

来源与致谢

本教程的截图来自 Benji's AI Playground 的公开演示视频。每个步骤都链接到视频中的对应时间点,方便你对照学习。

Benji's AI Playground ↗

Qwen Image 2.1 真正吃的提示词结构

  1. 1

    从官方改写系统提示词起步

    Qwen 团队随 prompt enhancer 模型附了一份系统提示词,Loop Forge 直接让编码助手读了这份「图像提示词改写专家」模板:把粗略想法改写成一段完整英文长段落,逐条固定你写明的颜色、位置、物体数量和画面文字,再附一条短提示词声明哪些内容必须原样保留。八步按顺序执行、后面的步骤不改前面的结论——借用这套纪律,比自由发挥靠谱。

    Loop Forge 演示幻灯片,展示 Qwen 图像提示词改写专家官方系统提示词,含第一步读懂需求与第二步固定画面框架的规则说明
    官方改写系统提示词:一段话进,八个有序步骤,绝不回改。视频 4:35 处
  2. 2

    格式化段落胜过千字小作文

    Benji 测了一天后的结论:高质量输出不等于长篇大论。Qwen 官方系统提示词给模型留好了主体、风格、光线、文字内容各就各位的槽位,右侧这张剪纸风人物拼贴就出自一段结构化段落,而不是一堆形容词的堆叠。他自己写的 ComfyUI 节点会调用官方改写模型,帮你自动完成这套格式化。

    ComfyUI 工作流截图,结构化的 Qwen Image 2.1 文本提示词节点旁边是一张绿色拼贴人像,人物戴墨镜穿花纹外套
    结构对结构:格式槽位比形容词堆砌更有用。视频 5:00 处
  3. 3

    先算分辨率账,再写提示词

    Loop Forge 的耗时表把「编辑税」写得很直白:100 万像素出图 52 秒、编辑 78 秒;到 200 万像素编辑要花 2.45 倍于生成的时间。模型快到 Benji 直接把默认 25 步拉到 50 步——这个速度下步数是质量旋钮,不是等待问题。顺带看清角落小字:许可证已换成 Qwen Research,不再是 Apache 2.0。

    What it costs 幻灯片,列出 Qwen Image 2.1 从 100 万像素 52 秒到 430 万像素 403 秒的生成与编辑耗时对照表,角落附 Qwen Research 许可证说明
    编辑耗时约为生成的 1.5 至 2.7 倍,写提示词前先看分辨率档位。视频 5:05 处

文字与图表渲染:提示词管创意,数字手动修

  1. 4

    文字清晰可读的活动海报

    2.1 版的英文和中文文字渲染比上一代干净得多,活动海报和样机图变成一句提示词的事。这张 Northern Lights 田野录音海报的标题、日期栏、场地地址和 NL 圆标一轮生成全部可读——诀窍是按区块描述版式(标题、信息框、页脚行),让模型自己排字。

    AI 生成的 Northern Lights 田野录音音乐会海报,深色背景上有白色标题字、青色信息框以及场地与票务信息
    标题、日期框、页脚行一轮生成全部清晰可读。视频 4:20 处
  2. 5

    带图解的白板讲解图

    概念图板是甜点区:这张「经典 vs 量子」白板画了灯泡与轨道草图、布洛赫球、线路记号,还配了叠加与纠缠的要点列表。这个规模下拼写基本正常,幻灯片式讲解图属于安全的提示词族——模型负责传达想法,不负责记账。

    白板风格渲染图,对比经典计算与量子计算,画有灯泡草图、布洛赫球图解、线路记号以及叠加与纠缠的要点列表
    想法级图解扛得住;Benji 跑了 50 步让线条更干净。视频 7:55 处
  3. 6

    蓝图:版式能用,数字重做

    一旦观众会验算,同族提示词就露馅。这张分区图版式全对——住宅、商业、工业色带配图例——但标注的尺寸经不起细读。任何带测量数字的图,都把渲染结果当草稿:重新生成拿版式,真数字进编辑器手填。

    蓝图风格建筑分区图,蓝纸上有住宅商业工业三色分区、建筑轮廓、列车和尺寸标注
    版式可信,尺寸瞎编——观众可能验算的图必须人工复核。视频 9:10 处

编辑工作流:圈选、蒙版与 RGBA 抠图

  1. 7

    先圈住物体,再只说它的变化

    局部编辑是本代招牌:圈住画面里的区域,只描述这一处的变化——这里的沙滩冰桶被指令「嵌进沙子里」,画面其余部分纹丝不动。Loop Forge 的两条纪律:选区和句子必须指向同一处;圈要画大一点,曾有太小的圈没圈住叶子,结果模型长出了新叶子而不是改旧叶子。

    海滩照片编辑演示,毛巾上躺着一对情侣,旁边是装满酒瓶的冰桶,底部指令栏写着把桶修改成嵌进沙子里
    圈一个物体,写一句它的话——画面其余部分全部冻结。视频 2:40 处
  2. 8

    用 Image 1、Image 2 标签换装

    Qwen 文档定义了多图编辑的「Image 1, Image 2」标签写法,换装是标准用法:指认一张图里的连衣裙、另一张图里的外套,让模型给人物换装,同时保留 Image 1 的脸、发型、姿势和背景。回报是纺织品质保真——上身效果的碎花印花和平铺布料逐针对应。

    平铺在木地板上的黑色碎花连衣裙与穿在同一件裙装配牛仔外套的女人的对比图,1461 乘 2048 分辨率下图案完全一致
    上身图复刻了平铺图的印花——参考标签的价值就在纹理保真。视频 6:15 处
  3. 9

    圈选不够用时,画蒙版

    要外科手术级的控制,ControlNet 应用节点接受独立的 inpaint 图像和蒙版输入:打开蒙版编辑器,精确涂出要重绘的区域——这里是这只衣袖——原照片作为底图输入。编辑区边界硬、或旁边有经不起重采样的细节时,蒙版比圈选稳。

    ComfyUI 蒙版编辑器界面,白色影棚背景前穿棕色皮夹克和牛仔裤的女人,一只衣袖被涂上黑色蒙版
    涂蒙版、锁底图:只有衣袖会被重采样。视频 8:15 处
  4. 10

    把负向提示词写成验收标准

    配合蒙版的局部重绘提示词是一对。正向:Image 1 仅作身份与外观参考,保持同一位女性,把红色皮夹克换成合身黑色 T 恤。负向:身份漂移、服装颜色变化、手部畸形、多出手指、水印。把你拒绝的失败模式一条条列出来,编辑才不会跑偏。

    Text Encode Qwen Image 2.1 提示词节点,正向提示词要求把红色皮夹克换成黑色 T 恤,负向提示词列出身份漂移与手部畸形等排除项
    正向写要什么,负向列怕什么。视频 9:15 处
  5. 11

    要「新建透明图」,不要「去掉背景」

    透明通道是原生能力——去年 12 月的 Layered 模型已并入 2.1,不需要独立的抠图节点和蒙版流程。Loop Forge 的排错笔记比功能本身更值钱:让模型「从这张图里去掉背景」抠出来满是噪点,改成「新建一张该物体的透明图」就干净了。同一招还能产出整版 RGBA 素材表,比如这张八件套手绘物件平铺。

    透明背景幻灯片,展示要求生成八件手绘卡通物体的 RGBA 平铺素材表、带透明通道的提示词文本
    措辞就是修法:说「新建透明图」,alpha 通道就干净。视频 1:40 处

多图参考提示词:穿搭、软装与角色一致性

  1. 12

    最多十张参考图,拼出一套穿搭

    编辑最多接受 10 张参考图,电商演示是最直观的用法:裤子、格子衬衫、墨镜各来一张图,一句提示词让人物全套上身。不是每件衣服都完美——Benji 的背带裤回来时两条背带被「一本正经」地没有穿进扣环——上商品页前留一轮人工复核。

    ComfyUI 工作流截图,裤子格子衬衫墨镜三张参考图合成出一张男人全身穿搭照
    三张商品图进,一套穿搭出——留一眼复核怪细节。视频 11:40 处
  2. 13

    在提示词里给每张图分工

    室内软装演示了参考语法最明确的写法:Image 1 声明为「空客厅、目标区」,之后每张图写明从它取什么——沙发、茶几、电视墙。填好的房间布局与光线连贯,但模型自己承认没有空间尺度,家具尺寸当参考看,下单前自己量。

    ComfyUI 提示词节点,声明 Image 1 为空客厅目标区,后续图像分别提供白色沙发茶几与电视墙,用于室内设计渲染
    每张参考图标明角色——目标区在前,素材图在后。视频 12:55 处
  3. 14

    角色转面表解锁镜头运动

    角色转面表(turnaround sheet)是一致性工具:把多角度表和场景一起喂给模型,它就能让同一个角色换机位——Benji 把酒店房间镜头转到了房间另一侧,单张正面照做不到,因为模型根本不知道后脑勺长什么样。同一类转面表还能喂分镜和视频模型的首帧。

    ComfyUI 工作流,白衬衫女性五视角角色转面表旁边是同角色反向机位的酒店房间渲染图
    把后脑勺喂给模型,它就敢从背后拍。视频 15:25 处

ControlNet 进阶:姿势与深度的提示词配合

  1. 15

    姿势迁移:先同尺寸,再降强度

    ControlNet 附件是一个 7.55 GB 的单文件,覆盖八种控制类型——pose、depth、canny、HED、lineart、MLSD、scribble、grayscale——外加局部重绘支持。姿势迁移的修法很机械:先把源图和控制图缩放到同一分辨率。难姿势还把手画崩,就用文字描述姿势并把强度从 1.0 降到 0.8,让模型在句子和骨架之间偏向句子。

    双联 ComfyUI 结果对比图,左侧是白 T 恤蓝短裤的男人,右侧是经 ControlNet 复制同款张开双臂动态姿势的棕色皮夹克女人
    同尺寸输入加 0.8 强度,把崩坏的姿势迁移修干净。视频 4:40 处
  2. 16

    深度控制:换材质不挪家具

    深度控制锁住几何,其余全归提示词。验证过的模板:保留控制结构里的相机位置、房间透视、天花板高度、窗户与家具摆放,然后替换材质——深色石材、烟熏玻璃、哑光黄铜、深色实木——再加暖色间接光和窗外夜景。白天变黑夜,每盏灯都在原位。人物用 DW pose,房间用 Depth Anything V2 预处理器。

    ComfyUI 提示词节点,深度控制提示词要求把客厅改成夜晚深色家具的奢华风格,同时保留相机位置与家具摆放
    几何交给深度图,材质和光线交给句子。视频 7:00 处

常见问题

继续探索