【免费下载链接】Qwen-Image-2.1
Qwen's most powerful open-source image generation model
Qwen-Image-2.1 是通义千问团队开源的文生图生成与图像编辑模型,最大亮点是支持一次传入最多10 张参考图,完成合影生成、全身穿搭合成等多图编辑任务。下面为新手完整讲解玩法与操作步骤。
🖼️ Qwen-Image-2.1 多图参考编辑能做什么
Qwen-Image-2.1 是一个"文生图 + 图像编辑"二合一的统一模型,视觉生成组件仅 7B 参数(32 层 Single-Stream DiT),兼顾生成质量与推理效率。核心能力一览:
- 多图参考:最多 10 张参考图,多主体自由组合
- 合影生成:多张人像照片合成同一场景合影,面部特征保持一致
- 全身穿搭合成:"模特 + 衣服 + 鞋 + 包 + 帽子"多张参考合成一套完整造型
- 局部编辑:用圆圈、涂画标注或独立掩码指定局部修改
- 原生透明:直接生成带 alpha 通道的 RGBA 透明图
- 原生 2K 分辨率:支持 1:1、4:3、16:9 等 7 种画幅比
架构细节可查阅 README.md 的 Architecture 章节。
一键安装步骤:快速搭好运行环境
用 pip 安装核心依赖即可(需最新版本的 diffusers,提供QwenImage21Pipeline接口):
pip install "torch>=2.4.0" "transformers>=5.17" diffusers accelerate pillow模型权重可从 ModelScope 或 Hugging Face 下载,生态侧还支持 ComfyUI、vLLM-Omni、SGLang 等推理框架,详见 README.md 的 Community Support 部分。
如何传入10张参考图:合影生成实战
把多张图片组成PIL 图片列表,直接传给image参数,用提示词说明人物关系即可:
images = [Image.open(f"ref_{i}.png") for i in range(3)] # 最多 10 张 result = pipe( prompt="这三位人物坐在森林的篝火旁,保持各自的面部特征不变", image=images, num_inference_steps=40, ).images[0]官方展示案例已用 6 张单人肖像生成了整张合影。仓库自带的编辑示例数据中还有一个multi_portrait双人合影案例(将两位人物置入直播间场景拍合影),见 edit_example.jsonl:
全身穿搭生成:5张参考图组合一套造型
官方"全身穿搭"案例将模特、衣服、鞋、包、帽子5 张参考图组合成一张完整的全身造型图。使用建议:
- 在提示词里给每张参考图明确角色:谁是画面主体,谁只提供参考素材
- 需要保持不变的部分显式写"保持 XX 外观不变"
多图参考标注规则:用 指明每张图的角色
多图输入时,官方规范要求必须用<image1>、<image2>标签引用图片,不要写"图1 / 第一张图 / image A":
- 明确哪张是"画布"(构图与未修改内容保留)、哪些是素材来源
- 合影、一起变老这类无画布新场景任务,所有图片都作为身份来源
- 每张参考图要逐张单独描述,不要合并成一组笼统带过
完整规则见 system_prompt_edit.txt。示例数据中的真实写法:
将 中的人物和 中的人物置入一个现代直播间的场景中,生成一张两人并排坐在直播桌后共同面向镜头的合影照片。保持两位人物的面部特征、发型和服装外观完全不变。
官方提示词改写:让效果再上一个台阶
官方配套了两个微调版 Qwen3.5-VL 9B 提示词改写模型(T2I 一个、Edit 一个),把简短粗放的提示词自动扩写成详细、可执行的长提示词,并推荐输出画幅:
| 模式 | 作用 | 输出字段 |
|---|---|---|
| t2i | 短请求扩写为长提示词 | rewritten_prompt、wh_ratio |
| edit | 模糊编辑指令改写成精确指令 | rewritten_prompt、wh_ratio、ratio_follow |
python run_vllm.py --task edit \ --ckpt Qwen/Qwen-Image-2.1-PE-I2I \ --input data/edit_example.jsonl --output out.jsonl全部代码位于 prompt_rewrite/ 目录,使用说明见 prompt_rewrite/README.md。单次验证用 run_transformers.py,想做成服务则用 serve.sh + client.py。
其他热门编辑场景速览
Qwen-Image-2.1 处理单图编辑同样出色:
局部细节编辑—— 例如"只把头转向左侧,身体和手臂不动":
创意变形—— 例如"把这个徽标画成在空中飘扬的旗帜":
图内文字编辑—— 例如把动漫插图里的日本文字翻译成印地语:
单图全景—— 一张自拍扩展成 2:1 的全景画面:
出图画幅与分辨率:如何选输出画布
Qwen-Image-2.1 原生 2K,常用推荐分辨率:
| 比例 | 分辨率 |
|---|---|
| 1:1 | 2048×2048 |
| 4:3 | 2400×1792 |
| 3:4 | 1792×2400 |
| 16:9 | 2752×1536 |
| 9:16 | 1536×2752 |
两条经验法则:
- 换背景、换脸、换装等局部编辑 → 跟随画布图的画幅(
ratio_follow) - 合影、穿搭等新场景合成 → 按场景选比例(官方建议合影用 3:2)
默认参数:num_inference_steps=40,2048×2048 分辨率。
❓ 常见问题
显存不够怎么办?单卡 40GB 可舒适运行;显存紧张时调用pipe.enable_model_cpu_offload()做模型卸载,多参考图编辑还会自动复用前缀 KV 缓存以加速。
提示词可以用中文吗?可以,中英文提示词均支持;提示词改写模型还支持任意语言输入,并按语言规则输出改写结果。
合影人物相似度不够?搭配官方提示词改写模型使用,提示词中显式写明"保持面部特征、发型完全不变",并尽量使用脸部清晰的参考图。
📁 相关路径速查
- 项目主文档:README.md
- 提示词改写文档:prompt_rewrite/README.md
- 编辑系统提示词:system_prompt_edit.txt
- 编辑示例数据:edit_example.jsonl
- 许可协议:LICENSE
【免费下载链接】Qwen-Image-2.1
Qwen's most powerful open-source image generation model
相关推荐
拆解 Qwen-Image-2.1 的『改图』革命:RGBA 透明图 + 最多 10 张参考图,生成编辑一体的底气在哪
拆解 Qwen Image 2.1 的『改图』革命:RGBA 透明图 + 最多 10 张参考图,生成编辑一体的底气在哪 2026 年 9 月下旬,阿里千问开源
人工智能大模型模型量化本地部署媒体生成Qwen-Image-2.1 进阶编辑技巧:10张参考图+局部圈选,人像产品身份精准保持
Qwen Image 2.1 进阶编辑技巧:10张参考图+局部圈选,人像产品身份精准保持 Qwen Image 2.1 是 Qwen 团队开源的 AI 图像编辑
人工智能大模型媒体生成多模态openpilot开源驾驶辅助系统新手教程:从装到上车只需3步
openpilot开源驾驶辅助系统新手教程:从装到上车只需3步 openpilot 是一款开源驾驶辅助系统,目前支持 300 多款车型,上车后能直接升级原车的自
自动驾驶人工智能计算机视觉深度学习机器人
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考