模型 / 官方
7B 参数统一文生图与图像编辑
阿里巴巴 Qwen 团队于 2026 年 9 月 20 日正式开源 Qwen-Image-2.1,这是 Qwen 家族迄今最强的图像生成模型。该模型视觉生成组件仅有 7B 参数,采用 32 层单流 DiT 架构,通过混合粒度注意力机制与前缀 KV 缓存复用,在保持高图像质量的同时大幅降低推理开销。Qwen-Image-2.1 将文本生成图像与图像编辑统一于单一模型,原生支持 RGBA 透明图层生成、主体抠图,以及最多 10 张参考图的多主体合成。模型默认输出 2K 分辨率,支持 1:1、16:9、9:16 等多种常用比例。发布当日,Diffusers、ComfyUI、vLLM-Omni、SGLang 及 LightX2V 均已提供 Day-0 原生支持,权重同步上线 HuggingFace 与 ModelScope,并附带专用提示词改写模型以提升生成质量。
Qwen-Image-2.1 的核心架构由 32 层单流 DiT(Diffusion Transformer)层构成,视觉生成组件参数量为 7B。团队引入混合粒度注意力机制,使模型能够在不同细节层级上同时建模图像内容;前缀 KV 缓存复用则显著减少重复计算,令推理速度与显存占用均优于同级别模型。这一设计使 Qwen-Image-2.1 在轻量化前提下仍能输出具备竞争力的图像质量。
在功能层面,Qwen-Image-2.1 将文生图与图像编辑整合为统一接口。用户可通过同一模型完成从文本描述生成图像、对已有图像进行局部或全局编辑、提取照片中的主体对象等多类任务。编辑操作支持圆圈标注、涂抹标注或独立蒙版三种方式指定编辑区域,并能在编辑过程中保持人物或产品的身份一致性,最多可同时引入 10 张参考图进行多主体合成。
透明图像生成是本次发布的亮点之一。Qwen-Image-2.1 原生支持 RGBA 格式输出,用户只需在提示词中加入特定格式说明,模型即可生成带有透明通道的图像,适用于贴纸制作、UI 素材生成及图层化设计工作流。此外,模型在排版文字渲染、人像光影处理及细节精度方面均有显著提升,生成结果的视觉表现力更为突出。
模型默认以 2048×2048 像素输出,原生支持 2K 分辨率,并提供 1:1、4:3、3:4、3:2、2:3、16:9、9:16 等多种预设比例,最大尺寸可达 2752×1536(16:9)或 1536×2752(9:16)。默认推理步数为 40 步,开发者可根据速度与质量需求自行调整。整套 API 通过 Diffusers 库的 QwenImage21Pipeline 提供,调用方式与主流扩散模型保持一致。
为进一步提升生成质量,Qwen 团队同步发布了两个基于 Qwen3.5-VL 9B 微调的提示词改写模型,分别针对文生图(Qwen-Image-2.1-PE-T2I)和图像编辑(Qwen-Image-2.1-PE-I2I)场景,共用同一代码库并通过参数自动识别任务类型。发布当日,Diffusers、ComfyUI、vLLM-Omni、SGLang 及 LightX2V 均已完成适配,其中 vLLM-Omni 支持 FP8 量化与张量并行,SGLang 支持 Cache-DiT 与环形并行,为大规模部署提供了完整的推理加速方案。
要点
- Qwen-Image-2.1 以 7B 参数统一文生图与图像编辑,原生支持 2K 分辨率输出及 RGBA 透明图层生成
- 单一模型支持最多 10 张参考图的多主体合成,并可通过圆圈、涂抹或蒙版精确指定编辑区域
- 发布当日即获 Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V 五大框架 Day-0 原生支持
- 配套提示词改写模型(基于 Qwen3.5-VL 9B)可将简短描述扩展为高质量详细提示,显著提升生成效果
- 权重已同步上线 HuggingFace 与 ModelScope,支持 FP8 量化与多种并行策略,适合生产级部署
原始标题:QwenLM/Qwen-Image-2.1 — Qwen's most powerful open-source image generation model
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。