【免费下载链接】Qwen-Image-2.1
Qwen's most powerful open-source image generation model
Qwen-Image-2.1 是 Qwen 团队开源的最强AI 图像生成与图像编辑模型,仅 7B 参数的视觉生成组件就统一了文生图、图像编辑、透明背景生成三大能力。本文将Qwen-Image-2.1支持的 6 大平台——Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V、ModelScope——逐一拆解,帮你在 10 分钟内挑对工具、跑通第一张图 🚀
🗺️ 一图看懂:Qwen-Image-2.1 的核心能力
在盘点平台之前,先快速了解这个模型强在哪里:
- 紧凑高效:7B 参数 + 32 层单流 DiT,混合粒度注意力与前缀 KV 缓存复用,显存占用低、出图快
- 原生透明:直接生成 RGBA 透明背景图,还能抠图、编辑透明图层
- 多图编辑:最多支持10 张参考图,圈选/涂绘/遮罩都能做局部编辑,人物和商品身份保持一致
- 2K 原生分辨率:原生支持 2K,提供 1:1、16:9、9:16 等 7 种推荐画幅
下面这张全景图就是用 Qwen-Image-2.1 从一张自拍照生成的(官方 Showcase 案例):
📋 6大支持平台速查表
| 平台 | 定位 | 最适合谁 |
|---|---|---|
| Diffusers⭐官方推荐 | 代码调用,单管线搞定文生图+编辑 | 开发者、脚本化出图 |
| ComfyUI | 可视化工作流,Day 0 原生支持 | 喜欢拖拽节点的创作者 |
| vLLM-Omni | 高性能推理 + 在线 API 服务 | 需要高并发、对外提供服务的团队 |
| SGLang | 多卡并行 + 优化内核 | 数据中心多 GPU 部署 |
| LightX2V | 推理速度与显存效率双优化 | 数据中心 & 消费级显卡用户 |
| ModelScope | 在线生成 + LoRA 训练一站式 | 无显卡用户、想微调 LoRA 的新手 |
权重统一在 Hugging Face 与 ModelScope 的Qwen/Qwen-Image-2.1下,各平台均可直接加载。
① Diffusers:官方推荐,新手首选
Diffusers 是官方推荐的首选路径,通过QwenImage21Pipeline一个管线就同时支持文生图和图像编辑,无需切换模型:
from diffusers import QwenImage21Pipeline import torch pipe = QwenImage21Pipeline.from_pretrained( "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16 ).to("cuda") image = pipe( prompt="A neon shop sign that reads \"QWEN IMAGE 2.1\", rainy night", num_inference_steps=40, ).images[0] image.save("t2i_example.png")几个实用要点:
- 默认 40 步去噪、2048×2048 分辨率,默认参数即可出好图
- 显存紧张?调用
pipe.enable_model_cpu_offload()自动 CPU 卸载 - 透明图生成有官方推荐 prompt 模板(见 README.md "Transparent Image Generation" 小节),照抄即可
- 多参考图编辑:把
image=传一个图片列表(最多 10 张)就行
依赖安装极简:torch>=2.4.0+transformers>=5.17+ 最新版diffusers+accelerate+pillow,完整清单见 README.md 的 Quick Start 部分。
② ComfyUI:拖拽式工作流,原生支持免插件
ComfyUI 对 Qwen-Image-2.1 做到了Day 0 原生支持——不需要装任何第三方自定义节点,更新核心版本后即可直接使用:
- 兼容版权重在
Comfy-Org/Qwen-Image-2.1,与原版权重分开打包,下载即用 - 官方提供文生图和图像编辑两套示例工作流模板,导入即可运行
- 适合做批量出图、风格化流水线,节点化结构方便把 prompt 改写、VAE 解码等步骤自由组合
如果你熟悉 SD/Flux 的 ComfyUI 工作流,迁移成本几乎为零:下载权重、导入模板、连好输入输出即可出图。
③ vLLM-Omni:高性能推理与在线 API 服务
当你需要批量出图或对外提供 API时,vLLM-Omni 是官方支持的推理加速方案,核心亮点:
- 前缀 KV 缓存复用+ 专用 CUDA Graph 解码,大幅减少重复计算
- FP8 量化,显存直接砍半
- TP / Ulysses 并行,多卡水平扩展
- 支持 step 级连续批处理调度,GPU 利用率更高
离线推理一条命令出图;在线服务只需:
vllm serve Qwen/Qwen-Image-2.1 --omni --port 8091随后通过标准 OpenAI 风格接口POST /v1/images/generations就能以 prompt + size + seed 请求图片,接入现有业务非常顺滑。完整量化、并行与压测细节见 README.md 的 "Inference with vLLM" 小节。
④ SGLang:多卡并行与优化内核
SGLang 的 SGLang-Diffusion 分支对 Qwen-Image-2.1 提供 Day-0 原生支持,主打数据中心级吞吐:
- 前缀缓存 + Cache-DiT,多条件图编辑任务提速明显
- TP / Ulysses / Ring / CFG 四种并行模式可选,按卡数自由组合
- 组件级显存卸载(component offload),显存不够也能跑
- 一条命令生成 1024×1024 图像:
sglang generate \ --model-path Qwen/Qwen-Image-2.1 \ --prompt "A capybara reading a book by candlelight" \ --height 1024 --width 1024 --num-inference-steps 40 --save-output图像编辑只需追加--image-path input.png,透明背景、多图参考同样支持。
⑤ LightX2V:消费级显卡也能飞
LightX2V 是专注推理速度与显存效率的图像/视频生成框架,对 Qwen-Image-2.1 提供Day 0 加速,特点是:
- 在数据中心和消费级显卡上都做了深度优化,24GB 级显卡跑 2K 图更从容
- 文生图、图像编辑两大任务均支持
- 官方仓库内附带
qwen_image_21使用指南,照着配置即可上手
如果你是在家矿卡/游戏卡上跑 Qwen-Image-2.1,LightX2V 值得和官方 Diffusers 路径各跑一次 benchmark 再决定。
⑥ ModelScope:在线生成 + LoRA 训练一站式
没有 GPU?不想配环境?ModelScope 是最友好的入口:
- 在线生成:平台内置 Qwen-Image-2.1,浏览器打开就能出图,含透明背景生成
- 模型下载:权重在
Qwen/Qwen-Image-2.1,国内访问速度快 - LoRA 训练:基于开源的 DiffSynth-Studio 框架,支持在线微调 LoRA 适配器——想训练自己的角色、画风 LoRA,这里是最低门槛的路径
- 国内用户还可以体验 wuli.art 提供的免费全功能入口(Chatbox + 画布模式)
对新手而言,ModelScope 在线体验 → 本地 Diffusers 复现 → 最后上 LoRA 微调,是一条非常平滑的成长路径 📈
🎁 加分项:官方 Prompt 改写,出图质量翻倍
Qwen-Image-2.1 官方还附赠了两个基于 Qwen3.5-VL 9B 微调的提示词改写模型——把"一只在雨中弹吉他的柯基"这种短 prompt 自动扩写成电影级的长描述,出图质量肉眼可见地提升。
代码在 prompt_rewrite/ 目录,文生图(PE-T2I)与图像编辑(PE-I2I)两个任务共用一套代码:
- run_vllm.py:离线批量改写,生产推荐
- run_transformers.py:本地单条推理,方便调试
- serve.sh + client.py:起 vLLM 服务,HTTP 调用改写
示例输入输出见 data/t2i_example.jsonl 和 data/edit_example.jsonl。改写输出除了rewritten_prompt,还会给出wh_ratio(新画幅比例),建议连同 prompt 一起传给生成管线,避免构图跑偏。
下图就是 edit 示例里的输入素材(把图中的日文标题翻译成印地语),可见它连图中文字编辑这种精细任务都能处理:
多参考图场景下,改写模型会输出ratio_follow字段,指定输出画幅跟随哪张输入图——这对"保留人物身份的多图合影"类任务尤其关键:
🧭 新手选平台决策指南
不知道怎么选?对号入座:
- 🎓刚入门、想快速出图→Diffusers,10 行代码跑通
- 🎨可视化控、做工作流→ComfyUI,原生支持零插件
- 🚀要对外提供 API / 高并发→vLLM-Omni(在线服务)或SGLang(多卡吞吐)
- 💻消费级显卡本地部署→LightX2V,显存和速度双优化
- ☁️没显卡 / 想训 LoRA→ModelScope在线体验 + 微调
- 🐧AMD 显卡 / 国产芯片→ ROCm + Diffusers,或 FlagOS 软件栈(详见下文)
🖥️ 硬件支持:不止 NVIDIA
- AMD Radeon GPU:ROCm + PyTorch + Diffusers 组合即可跑高质量文生图
- FlagOS 异构芯片:通过开源系统软件栈 FlagOS + FlagGems 算子库,Qwen-Image-2.1 在 8 个芯片平台上提供预构建镜像与权重,零代码修改,推理精度与官方实现对齐
⚡ 快速开始:三步跑通 Qwen-Image-2.1
# 1. 克隆仓库 git clone https://gitcode.com/gh_mirrors/qw/Qwen-Image-2.1 # 2. 安装依赖 pip install torch>=2.4.0 transformers>=5.17 accelerate pillow pip install git+https://github.com/huggingface/diffusers # 3. 按上文任一平台的示例,加载 Qwen/Qwen-Image-2.1 出图完整命令与参数说明以 README.md 为准;模型授权条款见 LICENSE。
总结
Qwen-Image-2.1 的生态布局非常完整:Diffusers 打基础、ComfyUI 做创作、vLLM-Omni 和 SGLang 扛并发、LightX2V 降门槛、ModelScope 管体验与微调。无论你是写代码的工程师、拖节点的创作者,还是零基础的尝鲜用户,都能在这张"生态地图"上找到属于自己的那块拼图——挑一个平台,今天就生成你的第一张 AI 图吧 ✨
【免费下载链接】Qwen-Image-2.1
Qwen's most powerful open-source image generation model
相关推荐
DLSS Swapper 使用指南:如何管理和切换游戏里的 DLSS、FSR、XeSS DLL 版本
DLSS Swapper 使用指南:如何管理和切换游戏里的 DLSS、FSR、XeSS DLL 版本 DLSS Swapper 是一款免费的开源小工具,专门帮
桌面应用如何快速上手Qwen-Image 2.1:ComfyUI本地AI绘图3步部署完全教程(新手友好)
如何快速上手Qwen Image 2.1:ComfyUI本地AI绘图3步部署完全教程(新手友好) Qwen Image 2.1 是通义千问团队推出的新一代 AI
人工智能大模型媒体生成多模态Qwen-Image-2.1 上手指南:基于 diffusers 的统一文生图、图像编辑与 RGBA 透明图生成实战
Qwen Image 2.1 上手指南:基于 diffusers 的统一文生图、图像编辑与 RGBA 透明图生成实战 本指南以 Qwen Image 2.1 模
人工智能大模型媒体生成多模态
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考