Alibaba publicó el 20 de septiembre Qwen-Image-2.1, un modelo de generación y edición de imágenes con salida nativa 2K cuyo componente visual tiene 7,000 millones de parámetros. Qwen sostiene que supera a la mayoría de los modelos cerrados en su propio benchmark, una afirmación que The Decoder presenta como pendiente de evaluación independiente. El lanzamiento combina generación de imágenes RGBA con transparencia nativa, edición localizada y hasta 10 imágenes de referencia. Los pesos ya están disponibles, pero la licencia solo autoriza investigación y evaluación no comercial salvo que el usuario consiga un acuerdo separado.
La transparencia se integra en el modelo principal
Qwen-Image-2.1 puede generar una imagen convencional o un archivo RGBA con canal alfa a partir de una instrucción. También puede editar una capa transparente, conservar el fondo mientras cambia un elemento y extraer un sujeto desde una fotografía RGB para reutilizarlo en otra composición.
La diferencia práctica está en que esas tareas no aparecen como funciones separadas en distintos modelos. Qwen mostró ejemplos de objetos aislados, composiciones con varios elementos y cambios de texto dentro de una imagen transparente. Para diseñadores, tiendas en línea y equipos que producen recursos visuales, el flujo reduce la cantidad de pasos entre la generación y la preparación de un activo reutilizable, aunque la calidad final todavía depende de la prueba concreta y del hardware disponible.
Hasta 10 referencias y edición por regiones
El modelo admite hasta 10 imágenes de referencia en una misma tarea. Qwen mostró una fotografía grupal construida a partir de seis retratos, un conjunto de ropa armado con cinco imágenes y una habitación compuesta con 10 referencias de muebles.
La edición localizada puede indicarse con círculos, anotaciones pintadas o una máscara independiente. Eso permite pedir cambios simultáneos en zonas concretas, como retirar un reloj, cambiar el color del cabello y sustituir una prenda, mientras el resto de la imagen permanece como contexto.
La empresa también afirma haber mejorado la conservación de identidad en retratos y la consistencia de forma, textura y texto en productos. Son funciones relevantes para catálogos, pruebas de vestuario, storyboards e infografías, pero por ahora deben leerse como capacidades documentadas y demostradas por el propio equipo de Qwen, no como una validación independiente de resultados comerciales.
Los 7B describen el componente visual, no toda la carga
La cifra de 7B necesita una precisión técnica. Corresponde al transformer visual de 32 capas que genera la imagen. La arquitectura publicada también utiliza un codificador Qwen3-VL de 8B para procesar instrucciones e imágenes de entrada, además de un autoencoder RGBA de 64 canales.
Qwen afirma que su atención de granularidad mixta y la reutilización de la caché KV evitan recalcular el texto y las imágenes de referencia en cada paso de eliminación de ruido. RuntimeWire documentó una prueba de integración con Diffusers que registró 56.5 GiB de memoria pico en una Nvidia H100 para una imagen de 2,048 por 2,048 píxeles, con BF16, lote de una imagen y 20 pasos. Esa medición no representa todas las configuraciones, pero sirve para poner en contexto la palabra compacto: 7B en el componente visual no significa que cualquier computadora pueda ejecutar el modelo con facilidad a su resolución nativa.
La comparación con modelos cerrados sigue siendo una afirmación de Qwen
El anuncio incluye una comparación de Qwen-Image-Bench con modelos abiertos y cerrados. RuntimeWire señala que la herramienta usa 1,000 prompts y un Q-Judger ajustado sobre Qwen3.6-27B para puntuar cinco dimensiones, entre ellas calidad, estética, alineación, fidelidad del mundo real y generación creativa.
La metodología permite entender qué midió Qwen, pero también marca el límite de la conclusión. El juez, el conjunto de evaluación y el benchmark proceden del mismo ecosistema que publicó el modelo. The Decoder describió por eso la ventaja frente a la mayoría de los modelos cerrados como una afirmación de la compañía y señaló que todavía no había una evaluación independiente consolidada.
Por ahora, la formulación más precisa es que Qwen-Image-2.1 presenta resultados competitivos en la comparación publicada por su desarrollador. No hay base suficiente para convertir ese gráfico en un consenso sobre el mejor generador de imágenes disponible.
Pesos abiertos, pero uso comercial restringido
Qwen distribuye el modelo a través de GitHub, Hugging Face y ModelScope, y el repositorio documenta compatibilidad inicial con Diffusers, ComfyUI, vLLM-Omni, SGLang y LightX2V. Eso facilita que investigadores y desarrolladores descarguen los archivos, inspeccionen el código y hagan pruebas en infraestructura propia.
El contrato cambia la lectura para una empresa. La Qwen Research License Agreement concede derechos mundiales, gratuitos y no transferibles para usar, modificar y redistribuir los materiales únicamente con fines no comerciales. Cualquier uso comercial requiere una licencia separada de Hangzhou Tongyi Laboratory Technology Co.
El matiz importa porque "open-source" y "open-weight" no describen por sí solos las mismas libertades legales. FomoEra ya había documentado la diferencia entre pesos abiertos y licencia comercial en otros lanzamientos de Alibaba, y en Qwen-Image-2.1 la restricción está escrita de forma directa: descargar el modelo para investigarlo no equivale a poder integrarlo sin más en un producto, una tienda, una agencia o un servicio de pago.
Qwen-Image-2.1 llega con un conjunto de funciones poco habitual para un modelo visual de este tamaño, sobre todo por la transparencia RGBA y la edición con múltiples referencias. Su disponibilidad inmediata favorece las pruebas locales, pero su rendimiento todavía necesita mediciones externas y su licencia obliga a resolver el permiso comercial antes de convertirlo en parte de un producto.