Alibaba, das Unternehmen hinter der Qwen-KI-Plattform, hat kürzlich den Schleier über Qwen-Image gelüftet.
Das Qwen-Team beschrieb Qwen-Image in einem kürzlich veröffentlichten Blogbeitrag mit den Worten: „Wir freuen uns sehr, Qwen-Image zu veröffentlichen, ein 20-Milliarden-Parameter-MMDiT-Bildgrundlagenmodell, das bedeutende Fortschritte bei der komplexen Textdarstellung und der präzisen Bildbearbeitung erzielt.“
Das Modell zeigt starke Leistungen beim Einbetten mehrsprachiger Texte, darunter auf Chinesisch und Englisch, und erzeugt gleichzeitig präzise Visualisierungen auf Grundlage komplexer Nutzeranweisungen.
Die Fähigkeiten der Plattform unter Beweis stellen
Um die Bandbreite von Qwen-Image zu demonstrieren, bat das Qwen-Team die generative KI-Plattform darum, verschiedene Bilder zu erstellen, jeweils mit detaillierten Anweisungen und komplexen Vorgaben.
Zunächst bat das Team Qwen-Image, ein Bild im Anime-Kunststil von Hayao Miyazaki zu erstellen. Das Modell reproduzierte Miyazakis unverwechselbare Ästhetik erfolgreich und befolgte dabei die vorgegebenen Anweisungen.
Nachdem das Entwicklungsteam einige verschiedene Designs mit englischen und chinesischen Textprompts ausprobiert hatte, testete es Qwen-Images Fähigkeit, komplizierte, mehrstufige Anweisungen zu verarbeiten. In einem Test erzeugte das Modell effektiv zweisprachige Ausgaben und bettete englische und chinesische Texte in ein einziges Bildlayout ein.
Diese ersten Demonstrationen zeigten, dass sich Qwen-Image zur Erstellung von cartoonartigen Grafiken, realistischen Bildern, Infografiken, Postern und mehr einsetzen lässt.
Die Leistung von Qwen-Image im Vergleich zu anderen KI-Modellen
Die Leistung von Qwen-Image wurde außerdem direkt mit der von Modellen anderer KI-Unternehmen anhand verschiedener gängiger Benchmarks verglichen.
| Benchmark-Ergebnisse für Bildgenerierung und -bearbeitung (Quelle: offizieller Benchmark-Bericht von Qwen-Image) | ||||||
|---|---|---|---|---|---|---|
| Qwen-Image | GPT Image 1 (High) | FLUX.1 Kontext (Pro) | FLUX.1 (Dev) | Seedream 3.0 | Bagel | |
| DPG | 88.32 | 85.15 | — | 83.84 | 88.27 | — |
| One-IG-Bench-ZH | 0.548 | 0.474 | — | — | 0.528 | — |
| One-IG-Bench-EN | 0.539 | 0.533 | — | 0.434 | 0.530 | — |
| ImgEdit | 4.27 | 4.20 | 4.00 | — | — | 3.20 |
| GEdit-CN | 7.52 | 7.30 | 1.20 | — | — | 6.50 |
| GEdit-EN | 7.56 | 7.53 | 6.56 | — | — | 6.52 |
| GSO | 15.11 | 12.07 | 14.50 | — | — | 13.78 |
| GenEval | 0.91 | 0.84 | — | 0.66 | 0.84 | — |
| Benchmark-Ergebnisse für die Textdarstellung (Quelle: offizieller Benchmark-Bericht von Qwen-Image) | |||
|---|---|---|---|
| Qwen-Image | GPT Image 1 (High) | Seedream 3.0 | |
| LongText-Bench (ZH) | 0.946 | 0.619 | 0.878 |
| LongText-Bench (EN) | 0.943 | 0.956 | 0.896 |
| Chinese Word (ZH) | 0.583 | 0.361 | 0.331 |
| TextCraft (EN) | 0.829 | 0.857 | 0.592 |
| One-IG-Bench-Test (ZH) | 0.963 | 0.650 | 0.928 |
| One-IG-Bench-Test (EN) | 0.891 | 0.857 | 0.865 |
Während Qwen-Image bei den meisten Benchmarks klar vorn liegt, bleibt es bei der Darstellung englischer Texte hinter GPT Image 1 zurück. Angesichts des starken Fokus auf den heimischen Markt bei Alibaba stärkt die erstklassige Leistung von Qwen-Image bei chinesischen Texten seine Attraktivität für Nutzer in mehrsprachigen Umgebungen zusätzlich.
Qwen-Image in einem hart umkämpften Umfeld veröffentlichen
Obwohl die Entwickler von Qwen-Image die künstlerischen Fähigkeiten ihrer Plattform bereits unter Beweis gestellt haben, betreten sie einen hart umkämpften Bereich der generativen KI. Große Akteure wie OpenAIs DALL-E, Midjourney, Canva, Adobe Firefly und Stable Diffusion dominieren derzeit den Markt für visuelle KI.
Es bleibt abzuwarten, wie sich Qwen-Image gegen diese etablierten Tools behaupten wird, insbesondere in Regionen und Branchen, die von zweisprachiger Unterstützung und offenen Lizenzen profitieren.
Neugierig, wie KI die nächste Generation digitaler Kreativer unterstützt? Entdecken Sie unsere Übersicht kostenloser KI-Kunsttools, mit denen sich Ihre Ideen leichter denn je zum Leben erwecken lassen.

