news 2026/10/10 15:47:43

Qwen-Image-2.1多图参考编辑详解:如何用10张参考图生成合影与全身穿搭

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Qwen-Image-2.1多图参考编辑详解:如何用10张参考图生成合影与全身穿搭

【免费下载链接】Qwen-Image-2.1

Qwen's most powerful open-source image generation model

项目地址:https://gitcode.com/gh_mirrors/qw/Qwen-Image-2.1
点击查看免费下载

Qwen-Image-2.1 是通义千问团队开源的文生图生成与图像编辑模型,最大亮点是支持一次传入最多10 张参考图,完成合影生成、全身穿搭合成等多图编辑任务。下面为新手完整讲解玩法与操作步骤。

🖼️ Qwen-Image-2.1 多图参考编辑能做什么

Qwen-Image-2.1 是一个"文生图 + 图像编辑"二合一的统一模型,视觉生成组件仅 7B 参数(32 层 Single-Stream DiT),兼顾生成质量与推理效率。核心能力一览:

  • 多图参考:最多 10 张参考图,多主体自由组合
  • 合影生成:多张人像照片合成同一场景合影,面部特征保持一致
  • 全身穿搭合成:"模特 + 衣服 + 鞋 + 包 + 帽子"多张参考合成一套完整造型
  • 局部编辑:用圆圈、涂画标注或独立掩码指定局部修改
  • 原生透明:直接生成带 alpha 通道的 RGBA 透明图
  • 原生 2K 分辨率:支持 1:1、4:3、16:9 等 7 种画幅比

架构细节可查阅 README.md 的 Architecture 章节。

一键安装步骤:快速搭好运行环境

用 pip 安装核心依赖即可(需最新版本的 diffusers,提供QwenImage21Pipeline接口):

pip install "torch>=2.4.0" "transformers>=5.17" diffusers accelerate pillow

模型权重可从 ModelScope 或 Hugging Face 下载,生态侧还支持 ComfyUI、vLLM-Omni、SGLang 等推理框架,详见 README.md 的 Community Support 部分。

如何传入10张参考图:合影生成实战

把多张图片组成PIL 图片列表,直接传给image参数,用提示词说明人物关系即可:

images = [Image.open(f"ref_{i}.png") for i in range(3)] # 最多 10 张 result = pipe( prompt="这三位人物坐在森林的篝火旁,保持各自的面部特征不变", image=images, num_inference_steps=40, ).images[0]

官方展示案例已用 6 张单人肖像生成了整张合影。仓库自带的编辑示例数据中还有一个multi_portrait双人合影案例(将两位人物置入直播间场景拍合影),见 edit_example.jsonl:

全身穿搭生成:5张参考图组合一套造型

官方"全身穿搭"案例将模特、衣服、鞋、包、帽子5 张参考图组合成一张完整的全身造型图。使用建议:

  • 在提示词里给每张参考图明确角色:谁是画面主体,谁只提供参考素材
  • 需要保持不变的部分显式写"保持 XX 外观不变"

多图参考标注规则:用 指明每张图的角色

多图输入时,官方规范要求必须用<image1>、<image2>标签引用图片,不要写"图1 / 第一张图 / image A":

  • 明确哪张是"画布"(构图与未修改内容保留)、哪些是素材来源
  • 合影、一起变老这类无画布新场景任务,所有图片都作为身份来源
  • 每张参考图要逐张单独描述,不要合并成一组笼统带过

完整规则见 system_prompt_edit.txt。示例数据中的真实写法:

将 中的人物和 中的人物置入一个现代直播间的场景中,生成一张两人并排坐在直播桌后共同面向镜头的合影照片。保持两位人物的面部特征、发型和服装外观完全不变。

官方提示词改写:让效果再上一个台阶

官方配套了两个微调版 Qwen3.5-VL 9B 提示词改写模型(T2I 一个、Edit 一个),把简短粗放的提示词自动扩写成详细、可执行的长提示词,并推荐输出画幅:

模式作用输出字段
t2i短请求扩写为长提示词rewritten_prompt、wh_ratio
edit模糊编辑指令改写成精确指令rewritten_prompt、wh_ratio、ratio_follow
python run_vllm.py --task edit \ --ckpt Qwen/Qwen-Image-2.1-PE-I2I \ --input data/edit_example.jsonl --output out.jsonl

全部代码位于 prompt_rewrite/ 目录,使用说明见 prompt_rewrite/README.md。单次验证用 run_transformers.py,想做成服务则用 serve.sh + client.py。

其他热门编辑场景速览

Qwen-Image-2.1 处理单图编辑同样出色:

局部细节编辑—— 例如"只把头转向左侧,身体和手臂不动":

创意变形—— 例如"把这个徽标画成在空中飘扬的旗帜":

图内文字编辑—— 例如把动漫插图里的日本文字翻译成印地语:

单图全景—— 一张自拍扩展成 2:1 的全景画面:

出图画幅与分辨率:如何选输出画布

Qwen-Image-2.1 原生 2K,常用推荐分辨率:

比例分辨率
1:12048×2048
4:32400×1792
3:41792×2400
16:92752×1536
9:161536×2752

两条经验法则:

  • 换背景、换脸、换装等局部编辑 → 跟随画布图的画幅(ratio_follow)
  • 合影、穿搭等新场景合成 → 按场景选比例(官方建议合影用 3:2)

默认参数:num_inference_steps=40,2048×2048 分辨率。

❓ 常见问题

显存不够怎么办?单卡 40GB 可舒适运行;显存紧张时调用pipe.enable_model_cpu_offload()做模型卸载,多参考图编辑还会自动复用前缀 KV 缓存以加速。

提示词可以用中文吗?可以,中英文提示词均支持;提示词改写模型还支持任意语言输入,并按语言规则输出改写结果。

合影人物相似度不够?搭配官方提示词改写模型使用,提示词中显式写明"保持面部特征、发型完全不变",并尽量使用脸部清晰的参考图。

📁 相关路径速查

  • 项目主文档:README.md
  • 提示词改写文档:prompt_rewrite/README.md
  • 编辑系统提示词:system_prompt_edit.txt
  • 编辑示例数据:edit_example.jsonl
  • 许可协议:LICENSE

【免费下载链接】Qwen-Image-2.1

Qwen's most powerful open-source image generation model

项目地址:https://gitcode.com/gh_mirrors/qw/Qwen-Image-2.1
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/10 15:47:08

康普数据中心规划指南实战解析:物理层约束与跨系统耦合校验

简介&#xff1a;《美国康普数据中心规划指南》是一份面向智慧城市与人工智能领域基础设施建设者的专业级技术参考&#xff0c;适用于数据中心架构师、系统集成工程师及IT设施规划人员&#xff0c;解决高可靠、高扩展性数据中心从选址、设计到运维的全周期规划难题。资源为单文…

作者头像 李华
网站建设 2026/10/10 15:46:56

如何正确使用 su:BakaSU 权限管理、授权策略与 ADB Root 速查手册

【免费下载链接】BakaSU A KernelSU based root solution for Android 项目地址&#xff1a; https://gitcode.com/gh_mirrors/re/BakaSU 点击查看 免费下载 BakaSU 是一款基于 KernelSU 的 Android 内核 Root 方案。本文带你快速掌握三件事&#xff1a;su 命令的正确用法、管…

作者头像 李华
网站建设 2026/10/10 15:46:32

纯Numpy手写BP神经网络:MNIST手写数字识别准确率97%

简介&#xff1a;面向机器学习初学者与MATLAB使用者的手写数字识别实操项目&#xff0c;基于BP神经网络完成从图像输入到数字分类的完整流程&#xff0c;帮助理解反向传播、梯度下降与网络调参方法。这类技术常被用于邮政编码自动读取、银行签名验证和各类OCR系统&#xff0c;因…

作者头像 李华
网站建设 2026/10/10 15:46:26

Meshroom 三维重建实战:从照片到可量测模型的摄影测量管线与避坑指南

简介&#xff1a;Meshroom是一款基于摄影测量技术的开源三维重建软件&#xff0c;面向建筑测绘、考古记录、虚拟现实与游戏设计等领域的从业者及三维建模爱好者&#xff0c;无需专业扫描设备&#xff0c;仅凭多角度普通照片即可生成高精度三维模型。本资源为Windows免安装版本&…

作者头像 李华
网站建设 2026/10/10 15:44:46

订阅接入后的六个高频报错,从版本回落到额度读不到

把 ChatGPT / Codex 订阅接进 DeepSeek Harness&#xff08;下称 DSH&#xff09;&#xff0c;本质上是把一个外部账号体系塞进本地客户端的插件槽位里&#xff1a;登录走 OAuth、模型目录来自账号、额度来自服务端。链条一长&#xff0c;出错点就分散在“装、登、选、跑、看额…

作者头像 李华
网站建设 2026/10/10 15:44:41

装了 dsh-genui 却只看到代码块?七个真实故障的定位与修复

dsh-genui 装完之后最常见的抱怨不是「装不上」&#xff0c;而是「装上了&#xff0c;但回答里那个该变成看板的围栏&#xff0c;还是一坨代码」。这类问题的成因分散在激活链、宿主版本、包名、依赖与版本解析五个地方&#xff0c;但每一个都有明确的现象和判据。下面把七个高…

作者头像 李华