Qwen-Image-2.1

Qwen-Image-2.1 是通义 Qwen 团队于 2026 年 9 月 20 日开源的图像模型。它把生成和编辑放在同一个模型里,原生输出透明(RGBA)图像,单次编辑最多接收 10 张参考图,靠 7B 的生成 Transformer 支持 2K 分辨率。GoEnhance 目前还没有上线 2.1,所以下面的控制台打开的是站上最新的 Qwen 模型 Qwen Image 3。
中英双语海报排版
中英双语海报排版
中英双语海报排版
标签清晰的产品图
标签清晰的产品图
六格分镜
六格分镜
杂志感人像
杂志感人像
Qwen Image 3
提示词
示例提示词
将带着该模型和提示词打开 GoEnhance 创作台。

在 GoEnhance 用 Qwen Image 能做什么

文字不会糊掉的海报

把标题、日期和小字排进画面,中英文都能立住。适合真的要放文案的活动海报、主视觉和社交封面。

文字不会糊掉的海报

标签能看清的产品图

把产品放在干净背景上,光线保持柔和,标签文字仍然清楚。可以直接用于商品图、详情页和包装草案。

标签能看清的产品图

多格图板与网格

要六格图板、九宫格科普图还是设计版面,每一格都是同一种画风,小标题也能放在你指定的位置。

多格图板与网格

肤质和光线自然的人像

生成肤质真实、眼神有高光、窗光柔和的杂志感人像,之后只改服装或取景,人脸不会跑掉。

肤质和光线自然的人像

Qwen-Image-2.1 有什么新东西

原生透明,不是抠图

模型自带 64 通道 RGBA 自编码器,空间压缩 16 倍,透明是模型本身的能力而不是后期处理。可以直接按提示词生成透明图、编辑透明图层,也能把主体从普通照片里提出来。

生成和编辑同一个模型

文生图和图像编辑走同一条流水线。可以从提示词开始,也可以丢一张图进去改,或者一次请求里两件事一起做,中途不用换模型。

最多 10 张参考图

单次编辑最多可以给十张参考图:用多张单人照拼出合影,或者把模特、衣服、鞋、包、帽子的分开拍摄合成一整套穿搭。

直接圈出要改的地方

局部修改可以用圈选、手涂标注或单独的蒙版来指定。人物和商品的特征保持不变,只有你标出来的区域会变。

7B 的紧凑结构

生成 Transformer 是 32 层单流 DiT、7B 参数,文本编码器用 Qwen3-VL 8B。混合粒度注意力加上前缀 KV 缓存复用,提示词和参考图只编码一次,后续每一步复用。

原生 2K,文字更利落

推荐尺寸从 1:1 的 2048×2048 到 16:9 的 2752×1536,默认 40 步。排版、人像光线和细节质感都比上一代 Qwen-Image 更好。

自己把 Qwen-Image-2.1 跑起来

01

拿到权重

Qwen-Image-2.1 是开源权重。可以从 Hugging Face(Qwen/Qwen-Image-2.1)或 ModelScope 下载,也可以直接用 Comfy-Org/Qwen-Image-2.1 这份适配 ComfyUI 的版本。

02

选一个运行环境

Diffusers 首日就通过 QwenImage21Pipeline 支持,ComfyUI 也内置了生成和编辑的工作流。量大的话,vLLM-Omni、SGLang 和 LightX2V 提供前缀缓存、量化和多卡推理;AMD ROCm 和 FlagOS 适配的芯片同样能跑。

03

提示词、尺寸和透明

先用官方的提示词改写模型(生成用 PE-T2I,编辑用 PE-I2I),尺寸和步数按推荐的 2K 与 40 步来。要透明结果时,提示词开头按模型约定写明这是背景透明的 RGBA 图像。

Qwen-Image-2.1 与 GoEnhance 上的 Qwen Image 对比

对比项Qwen-Image-2.1(开源权重)Qwen Image 3(GoEnhance 站上)
在哪里跑自己的 GPU,或自己搭的云端环境浏览器里直接用,不用装东西
透明 RGBA 输出原生支持,也能编辑透明图层不支持
参考图单次编辑最多 10 张编辑器里支持参考图
分辨率原生 2K,最高 2752×1536支持 1K 和 2K 输出
文字渲染中英文排版比上一代更好中英文字和密集版面都稳
上手方式下权重、装环境、自己管显卡写提示词,点生成

Qwen-Image-2.1 常见问题

Qwen-Image-2.1 是什么?

它是通义 Qwen 团队开源的图像模型,把文生图和图像编辑做进了同一个模型。生成 Transformer 是 32 层单流 DiT、7B 参数,原生输出透明 RGBA 图像。权重于 2026 年 9 月 20 日公开。

能在 GoEnhance 上用 Qwen-Image-2.1 吗?

暂时不行。站上目前提供的是 Qwen Image 2、Qwen Image 2 Pro、Qwen Image 3 和 Qwen Image 3 Pro。这页的控制台打开的是站上最新的 Qwen Image 3,不用自己准备显卡就能试同一系列的效果。

商用是免费的吗?

仓库采用的是 Qwen Research License Agreement,和通常意义上的商用许可不一样。把权重或生成结果用在商业项目之前,请先读 GitHub 上的许可原文。

透明图是怎么生成的?

透明能力做在自编码器里:64 通道 RGBA VAE,空间压缩 16 倍。你在提示词里写明这是背景透明的 RGBA 图像,拿到的就是带真实 alpha 通道的图,而不是抠出来的蒙版。

需要什么硬件?

生成部分 7B、文本编码器 8B,实际用起来需要一块显存够用的较新显卡。社区的运行环境能帮上忙:vLLM-Omni 和 SGLang 支持 FP8 权重、CPU 卸载和多卡并行,LightX2V 则面向消费级显卡。

最多能用几张参考图?

单次编辑最多十张。这让多主体合成变得可用:一张画面里放多个人,或者用分开拍的产品图拼出一整套穿搭,而每个元素还认得出来。

在 GoEnhance 试试 Qwen Image 系列

Qwen-Image-2.1 是开源权重,要自己准备机器来跑。如果你更想写一句提示词就拿到图,就在 GoEnhance 打开 Qwen Image 3,从上面任意一个示例开始。

从 Qwen Image 3 开始