Alibabas Qwen-Modell hat den Sprung in die Spitzengruppe einer globalen Rangliste für KI-Programmierung geschafft und damit ein in China entwickeltes System vor eingesetzten Modellen von OpenAI und Google platziert.
Qwen3.7-Max belegte in der jüngsten WebDev-Rangliste von Code Arena den vierten Platz. Vor ihm lagen mehrere Anthropic-Claude-Modelle, während es die aufgeführten Modelle von zwei der meistbeachteten US-KI-Labore übertraf. Damit sichert sich Alibaba einen seltenen Platz unter den Top fünf in einem Benchmark, der testet, wie gut KI-Modelle Web-Apps entwickeln – und nicht nur Coding-Aufforderungen beantworten.
Das Ergebnis bedeutet nicht, dass Alibaba OpenAI oder Google bei KI insgesamt überholt hat. Es rückt jedoch Coding-Agenten und Entwicklertools noch stärker ins Zentrum des globalen KI-Wettlaufs.
Alibaba macht Boden bei der KI-Programmierung gut
Alibabas Qwen3.7-Max erzielte 1.541 Punkte und belegte in der jüngsten Coding-Rangliste von Code Arena den vierten Platz, berichtete die South China Morning Post.
Die Zeitung berichtete, dass das Modell die Modelle von OpenAI und Google übertraf. SCMP wies außerdem darauf hin, dass Anthropics Claude-Modelle die übrigen Plätze unter den Top fünf belegten und Alibaba damit der einzige nicht-US-amerikanische Entwickler in dieser Gruppe ist.
Alibaba Cloud positionierte Qwen3.7-Max als ein Modell für agentengesteuerte Workflows, darunter Programmierung, Büroautomatisierung und die Ausführung lang laufender Aufgaben.
„Qwen3.7-Max ist unser vielseitigstes und leistungsfähigstes Modell für agentengesteuerte Workflows“, schrieb das Qwen-Team.
Code Arena konzentriert sich auf die Entwicklung echter Apps
Laut Tech in Asia verwendet Code Code Arena, früher bekannt als WebDev Arena, Blindbewertungen anonymisierter Modellausgaben, um zu beurteilen, wie gut KI-Systeme anhand von Eingabeaufforderungen der Nutzer Webanwendungen entwickeln.
Dieser Ansatz unterscheidet sich von traditionellen Coding-Benchmarks wie HumanEval oder SWE-bench, die auf standardisierten Tests basieren. Code Arena soll widerspiegeln, wie Entwickler die Ausgabe eines Modells beim Erstellen interaktiver Web-Apps und anderer produktartiger Software beurteilen.
Der Benchmark wurde über einfache HTML-Seiten und Frontend-Komponenten hinaus erweitert und umfasst nun auch React-Apps mit mehreren Dateien, Dashboards, Browserspiele und andere produktartige Softwareaufgaben.
Qwen zieht in Entwicklertools ein
Alibaba hat die Coding-Fähigkeiten von Qwen mit Qwen Code, einem Open-Source-Terminal-Agenten, verbunden. Tech in Asia betonte, dass Qwen Code auf die APIs von Alibaba Cloud ModelStudio zugreifen und in Entwicklungsumgebungen, CI/CD-Workflows und HTTP-Dienste integriert werden kann.
Alibaba Cloud positionierte Qwen3.7-Max außerdem als ein Modell für agentengesteuerte Workflows, darunter Programmierung, Büroautomatisierung und die Ausführung lang laufender Aufgaben.
Alibaba verfügt nun über eine weitere Möglichkeit, um Entwickler für sich zu gewinnen, während KI-Coding-Tools sich über die Codevervollständigung hinaus in größere Software-Workflows bewegen. Das Ergebnis bei Code Arena ist nur ein einzelner Benchmark, und Ranglisten können sich schnell ändern. Die Platzierung von Qwen3.7-Max zeigt jedoch, dass der globale Wettbewerb bei der KI-Programmierung über OpenAI, Google und Anthropic hinaus breiter wird.
Lesen Sie auch: Google führt neue KI-Coding-Tools ein und arbeitet daran, Anthropic und OpenAI bei der Softwareentwicklung herauszufordern.


