La plupart des outils d’IA peuvent créer l’image. L’équipe Qwen d’Alibaba veut que son nouveau modèle prenne en charge davantage d’étapes, de la suppression de l’arrière-plan des sujets à l’édition d’éléments transparents sans avoir à les envoyer vers un autre outil.
Qwen-Image-2.1 associe un générateur visuel de 7 milliards de paramètres à la création texte-image, à l’édition, à la transparence RGBA native et à la prise en charge de 10 images de référence au maximum. Le système complet s’appuie également sur des composants supplémentaires. Les designers, les équipes e-commerce et les développeurs peuvent utiliser le même modèle pour créer des éléments graphiques, isoler des sujets, préserver les arrière-plans transparents pendant les retouches et intégrer plusieurs références dans une seule composition. L’équipe Qwen d’Alibaba a publié le modèle le 20 septembre, selon l’annonce officielle du projet.
Qwen intègre la transparence au modèle d’image principal
Qwen a indiqué que le générateur visuel de Qwen-Image-2.1 utilise 32 couches de Single-Stream Diffusion Transformer. L’attention à granularité mixte traite différemment le contenu textuel et visuel, tandis que la réutilisation du cache KV stocke les images de référence et les instructions au lieu de les recalculer à chaque étape de débruitage.
« La transparence native constitue un ajout majeur de cette version », a écrit l’équipe Qwen.
Qwen gérait auparavant la génération transparente avec le modèle distinct Qwen-Image-Layered. Qwen-Image-2.1 intègre cette fonctionnalité à son modèle d’image principal et peut renvoyer soit une image RGB standard, soit une image RGBA dotée d’un canal alpha, en fonction de l’invite.
Le modèle peut également extraire un sujet d’une photographie classique sous forme de calque transparent, modifier du texte tout en préservant l’arrière-plan et retoucher une partie d’un élément transparent existant. Qwen a présenté d’autres exemples combinant des portraits séparés en une photo de groupe, des vêtements et des accessoires dans le cadre d’un essayage virtuel, ainsi que des meubles en une seule pièce. Les utilisateurs peuvent guider les retouches locales avec des cercles, des zones peintes ou des masques distincts.
Alibaba compare son générateur 7B à des modèles propriétaires
Alibaba fait également de la taille du modèle un argument commercial. Le chiffre de 7B désigne le composant de génération visuelle de Qwen-Image-2.1, que l’entreprise décrit comme compact et efficace.
The Decoder a rapporté que Qwen-Image-2.1 avait devancé plusieurs modèles propriétaires dans le Qwen-Image-Bench d’Alibaba. Des résultats indépendants n’ont pas encore confirmé ces performances. Alibaba ayant développé l’évaluation, ses résultats doivent être lus comme une mesure réalisée par l’entreprise, et non comme un classement indépendant.
Ce qu’a constaté eWeek
Le chiffre de 7B ne couvre pas tous les composants utilisés par Qwen-Image-2.1. RuntimeWire a indiqué que le système utilise également Qwen3-VL 8B pour encoder les invites et les images d’entrée, ainsi qu’un autoencodeur RGBA à 64 canaux.
À retenir | Ce que montrent les sources | Pourquoi c’est important |
|---|---|---|
| La taille du modèle 7B | Le nombre de 7B s’applique au générateur visuel. Le système utilise également Qwen3-VL 8B et un autoencodeur RGBA. | Le chiffre de 7B ne suffit pas à montrer l’empreinte complète du déploiement. |
| Configuration matérielle requise | RuntimeWire a cité un test Diffusers qui a atteint un pic de 56,5 Gio de mémoire GPU lors de la génération d’une image 2K sur une Nvidia H100. The Decoder a rapporté que le modèle pouvait fonctionner sur une RTX 3090 avec une configuration différente. | Les besoins en mémoire peuvent varier selon la résolution, la précision, le déport de calcul et d’autres paramètres. |
| Utilisation commerciale | La licence de recherche couvre la recherche et l’évaluation non commerciales. L’utilisation commerciale nécessite un accord distinct avec Qwen. | La disponibilité des poids ne permet pas automatiquement un déploiement commercial sans restriction. |
Les rapports matériels utilisent des configurations différentes : leurs chiffres ne sont donc pas directement comparables. Ils montrent toutefois pourquoi le seul nombre de paramètres, 7B, ne permet pas à une équipe informatique de savoir de quelle puissance matérielle elle aura besoin.
Les conditions de licence ajoutent un autre point à prendre en compte. RuntimeWire et The Decoder ont tous deux souligné que la licence de recherche autorise la recherche et l’évaluation non commerciales, tandis que l’utilisation commerciale nécessite un accord distinct avec Qwen.
Pour les entreprises, Qwen-Image-2.1 pourrait se distinguer moins par le score d’évaluation rapporté par l’entreprise que par la combinaison, dans un même flux de travail, de la transparence, de l’extraction de sujets, de l’édition locale et de la génération à partir de plusieurs références. Avant de l’adopter, les équipes devront néanmoins tester la qualité des résultats sur leurs propres éléments, calculer les besoins en mémoire aux résolutions visées et déterminer si les conditions commerciales d’Alibaba correspondent au déploiement prévu.
À lire aussi : Qwen-Image-2.1 arrive alors que l’écosystème d’IA plus large d’Alibaba gagne en puissance, Qwen ayant dépassé les 3 milliards de téléchargements avant Meta et Google.


