Qwen-Image-2.1

Qwen-Image-2.1 é o modelo de imagem de pesos abertos da equipe Qwen, publicado em 20 de setembro de 2026. Gera e edita em um único modelo, produz imagens RGBA transparentes de forma nativa, aceita até 10 imagens de referência e trabalha em 2K com um transformador de geração de 7B. A GoEnhance ainda não hospeda a 2.1, então o console abaixo abre o Qwen Image 3, o modelo Qwen mais recente disponível aqui.
Tipografia de pôster bilíngue
Tipografia de pôster bilíngue
Tipografia de pôster bilíngue
Foto de produto com rótulo legível
Foto de produto com rótulo legível
Storyboard de seis quadros
Storyboard de seis quadros
Retrato editorial
Retrato editorial
Qwen Image 3
Instrução
Prompts de exemplo
Abre o editor da GoEnhance com este modelo e prompt prontos.

O que dá para criar com o Qwen Image na GoEnhance

Pôsteres cujo texto se sustenta

Posicione títulos, datas e letras miúdas em inglês ou chinês e receba um layout em que as letras permanecem legíveis. Serve para cartazes de evento, key visuals e capas sociais com texto de verdade.

Pôsteres cujo texto se sustenta

Fotos de produto com rótulos legíveis

Coloque o produto em um fundo limpo, mantenha a luz suave e o rótulo nítido. Bom para imagens de catálogo, fotos de anúncio e rascunhos de embalagem.

Fotos de produto com rótulos legíveis

Pranchas e grades de vários quadros

Peça uma prancha de seis quadros, um explicativo em nove blocos ou uma folha de design: cada quadro sai no mesmo estilo, com legendas onde você quiser.

Pranchas e grades de vários quadros

Retratos com pele e luz naturais

Gere retratos editoriais com textura de pele crível, brilho nos olhos e luz suave de janela, depois ajuste roupa ou enquadramento sem perder o rosto.

Retratos com pele e luz naturais

O que há de novo no Qwen-Image-2.1

Transparência nativa, não recorte

O Qwen-Image-2.1 traz um autoencoder RGBA de 64 canais com compressão espacial de 16x, então a transparência está no modelo e não no pós-processamento: imagens transparentes a partir do prompt, edição de camadas transparentes e extração de objetos de fotos comuns.

Um modelo para gerar e editar

Texto para imagem e edição usam o mesmo pipeline. Você parte de um prompt, entrega uma imagem para alterar ou faz as duas coisas em uma única requisição, sem trocar de checkpoint.

Até 10 imagens de referência

Envie até dez referências em uma edição: uma foto de grupo montada a partir de retratos individuais, ou um look completo reunido de fotos separadas de modelo, roupa, sapatos, bolsa e chapéu.

Aponte o que deve mudar

Edições locais podem ser marcadas com um círculo, uma anotação pintada ou uma máscara separada. O modelo mantém a identidade de pessoas e produtos e altera apenas a região marcada.

Arquitetura compacta de 7B

O transformador de geração tem 32 camadas DiT de fluxo único e 7B de parâmetros, com um codificador de texto Qwen3-VL de 8B. Atenção de granularidade mista e reuso de cache KV de prefixo codificam prompt e referências uma vez e reaproveitam em todos os passos.

2K nativo e tipografia mais nítida

Os tamanhos recomendados vão de 2048x2048 no quadrado até 2752x1536 em 16:9, com 40 passos por padrão. Tipografia, luz em retratos e texturas finas melhoraram em relação à versão anterior do Qwen-Image.

Como executar o Qwen-Image-2.1 por conta própria

01

Baixe os pesos

O Qwen-Image-2.1 tem pesos abertos. Baixe no Hugging Face (Qwen/Qwen-Image-2.1) ou no ModelScope, ou pegue a cópia pronta para ComfyUI em Comfy-Org/Qwen-Image-2.1.

02

Escolha um runtime

O Diffusers dá suporte desde o primeiro dia via QwenImage21Pipeline e o ComfyUI traz workflows nativos de geração e edição. Para cargas maiores, vLLM-Omni, SGLang e LightX2V adicionam cache de prefixo, quantização e inferência multi-GPU; AMD ROCm e chips FlagOS também são suportados.

03

Prompt, tamanho e transparência

Comece pelos checkpoints oficiais de reescrita de prompt (PE-T2I para gerar, PE-I2I para editar), mantenha os tamanhos 2K recomendados e os 40 passos e, para um resultado transparente, abra o prompt com a formulação RGBA que o modelo espera.

Qwen-Image-2.1 comparado ao Qwen Image na GoEnhance

AspectoQwen-Image-2.1 (pesos abertos)Qwen Image 3 (aqui na GoEnhance)
Onde rodaSua própria GPU ou um runtime em nuvem que você configuraNo navegador, sem instalar nada
Saída RGBA transparenteNativa, incluindo edição de camadas transparentesNão disponível
Imagens de referênciaAté 10 por ediçãoImagem de referência suportada no editor
Resolução2K nativo, até 2752x1536Saída em 1K e 2K
Renderização de textoTipografia melhor em inglês e chinêsTexto bilíngue sólido e layouts densos
Para começarBaixar pesos, instalar runtime, cuidar da própria GPUEscrever um prompt e gerar

Perguntas frequentes sobre o Qwen-Image-2.1

O que é o Qwen-Image-2.1?

É um modelo de imagem de pesos abertos da equipe Qwen que reúne geração a partir de texto e edição em um só modelo. O transformador de geração tem 7B de parâmetros em 32 camadas DiT de fluxo único e produz imagens RGBA transparentes de forma nativa. Os pesos foram publicados em 20 de setembro de 2026.

Posso usar o Qwen-Image-2.1 na GoEnhance?

Ainda não. A GoEnhance roda Qwen Image 2, Qwen Image 2 Pro, Qwen Image 3 e Qwen Image 3 Pro. O console desta página abre o Qwen Image 3, o modelo Qwen mais recente disponível aqui, para testar a família sem configurar uma GPU.

É livre para uso comercial?

O repositório é publicado sob o Qwen Research License Agreement, que não equivale a uma licença comercial comum. Leia o texto da licença no repositório do GitHub antes de usar pesos ou resultados em um projeto comercial.

Como ele gera imagens transparentes?

A transparência está no autoencoder: um VAE RGBA de 64 canais com compressão espacial de 16x. Você pede no prompt, dizendo que a imagem é RGBA com fundo transparente, e recebe um canal alfa real em vez de um recorte.

Que hardware é necessário?

É um modelo de geração de 7B com codificador de texto de 8B, então na prática é preciso uma GPU moderna com VRAM suficiente. Os runtimes da comunidade ajudam: vLLM-Omni e SGLang oferecem pesos FP8, offload para CPU e paralelismo multi-GPU, e o LightX2V mira placas de consumo.

Quantas imagens de referência ele aceita?

Até dez em uma edição. É isso que torna prática a composição com vários sujeitos: várias pessoas em uma cena, ou um look montado a partir de fotos de produto separadas, mantendo cada elemento reconhecível.

Teste a família Qwen Image na GoEnhance

O Qwen-Image-2.1 tem pesos abertos e roda no seu hardware. Se preferir escrever um prompt e receber a imagem pronta, abra o Qwen Image 3 na GoEnhance e comece por um dos exemplos acima.

Começar com o Qwen Image 3