Die meisten KI-Bildwerkzeuge können das Bild erzeugen. Alibabas Qwen-Team möchte, dass sein neues Modell mehr von dem übernimmt, was danach kommt – vom Freistellen von Motiven bis zur Bearbeitung transparenter Assets, ohne sie an ein anderes Tool übergeben zu müssen.
Qwen-Image-2.1 kombiniert einen visuellen Generator mit 7 Milliarden Parametern mit Text-zu-Bild-Erstellung, Bearbeitung, nativer RGBA-Transparenz und der Unterstützung von bis zu 10 Referenzbildern. Das vollständige System stützt sich außerdem auf zusätzliche Komponenten. Designer, E-Commerce-Teams und Entwickler können dasselbe Modell nutzen, um Assets zu erstellen, Motive freizustellen, transparente Hintergründe bei Bearbeitungen zu erhalten und mehrere Referenzen in einer Komposition zusammenzuführen. Alibabas Qwen-Team veröffentlichte das Modell am 20. September, wie aus der offiziellen Ankündigung des Projekts hervorgeht.
Qwen integriert Transparenz in das zentrale Bildmodell
Qwen zufolge verwendet der visuelle Generator von Qwen-Image-2.1 32 Single-Stream-Diffusion-Transformer-Schichten. Attention mit gemischter Granularität verarbeitet Text- und Bildinhalte unterschiedlich, während die Wiederverwendung des KV-Caches Referenzbilder und Anweisungen speichert, anstatt sie bei jedem Entrauschungsschritt erneut zu berechnen.
„Native Transparenz ist eine wichtige Neuerung in dieser Veröffentlichung“, schrieb das Qwen-Team.
Qwen unterstützte die transparente Generierung bislang mit dem separaten Modell Qwen-Image-Layered. Qwen-Image-2.1 integriert die Funktion in sein zentrales Bildmodell und kann abhängig vom Prompt entweder ein gewöhnliches RGB-Bild oder ein RGBA-Bild mit Alphakanal ausgeben.
Das Modell kann außerdem ein Motiv aus einem gewöhnlichen Foto als transparente Ebene extrahieren, Text ändern und dabei den Hintergrund erhalten sowie einen Teil eines vorhandenen transparenten Assets bearbeiten. Qwen zeigte weitere Beispiele, in denen separate Porträts zu einem Gruppenfoto, Kleidung und Accessoires zu einer virtuellen Anprobe sowie Einrichtungsgegenstände zu einem Raum zusammengefügt wurden. Nutzer können lokale Bearbeitungen mit Kreisen, aufgemalten Bereichen oder separaten Masken steuern.
Alibaba vergleicht seinen 7B-Generator mit geschlossenen Modellen
Alibaba macht außerdem die Modellgröße zu einem Teil seiner Argumentation. Die Angabe 7B bezieht sich auf die visuelle Generierungskomponente von Qwen-Image-2.1, die das Unternehmen als kompakt und effizient.
The Decoder berichtete, dass Qwen-Image-2.1 im Qwen-Image-Bench von Alibaba vor mehreren geschlossenen Modellen lag. Unabhängige Ergebnisse haben diese Leistung bislang nicht bestätigt. Da Alibaba den Benchmark entwickelt hat, sollten die Ergebnisse als Messung des Unternehmens und nicht als unabhängiges Ranking gelesen werden.
Die Erkenntnisse von eWeek
Die Angabe 7B deckt nicht jede von Qwen-Image-2.1 verwendete Komponente ab. RuntimeWire wies darauf hin, dass das System außerdem Qwen3-VL 8B zur Kodierung von Prompts und Eingabebildern sowie einen 64-Kanal-RGBA-Autoencoder verwendet.
Wissenswertes | Was die Quellen zeigen | Warum das wichtig ist |
|---|---|---|
| Die Modellgröße 7B | Die Angabe 7B gilt für den visuellen Generator. Das System verwendet außerdem Qwen3-VL 8B und einen RGBA-Autoencoder. | Die 7B-Angabe allein zeigt nicht den vollständigen Ressourcenbedarf für den Betrieb. |
| Hardwareanforderungen | RuntimeWire verwies auf einen Diffusers-Test, bei dem die GPU-Speichernutzung während der Generierung eines 2K-Bildes auf einer Nvidia H100 auf 56,5 GiB anstieg. The Decoder berichtete, dass das Modell mit einer anderen Konfiguration auf einer RTX 3090 ausgeführt werden konnte. | Die Speicheranforderungen können sich abhängig von Auflösung, Präzision, Auslagerung und anderen Einstellungen ändern. |
| Kommerzielle Nutzung | Die Forschungslizenz umfasst nichtkommerzielle Forschung und Evaluierung. Für die kommerzielle Nutzung ist eine separate Vereinbarung mit Qwen. | Offene Gewichte erlauben nicht automatisch eine uneingeschränkte kommerzielle Bereitstellung. |
Die Hardwareangaben beziehen sich auf unterschiedliche Konfigurationen und sind daher nicht direkt vergleichbar. Sie zeigen jedoch, warum die Anzahl der 7B-Parameter allein einem IT-Team nicht sagen kann, wie viel Hardware es benötigen wird.
Die Lizenzierung bringt einen weiteren Aspekt ins Spiel. RuntimeWire und The Decoder wiesen beide darauf hin, dass die Forschungslizenz nichtkommerzielle Forschung und Evaluierung erlaubt, während für die kommerzielle Nutzung eine separate Vereinbarung mit Qwen erforderlich ist.
Für Unternehmen könnte Qwen-Image-2.1 weniger durch den vom Unternehmen gemeldeten Benchmark-Wert hervorstechen als durch die Kombination aus Transparenz, Motivextraktion, lokaler Bearbeitung und Generierung mit mehreren Referenzen in einem einzigen Workflow. Vor der Einführung müssen Teams die Ausgabequalität mit ihren eigenen Assets testen, den Speicherbedarf bei den Zielauflösungen berechnen und prüfen, ob Alibabas kommerzielle Bedingungen zum geplanten Einsatz passen.
Mehr dazu: Qwen-Image-2.1 erscheint außerdem zu einem Zeitpunkt, an dem Alibabas umfassenderes KI-Ökosystem an Dynamik gewinnt und Qwen vor Meta und Google die Marke von 3 Milliarden Downloads überschreitet.


