Le modèle Qwen d’Alibaba s’est hissé dans le peloton de tête d’un classement mondial du codage par IA, plaçant un système développé en Chine devant des modèles déployés par OpenAI et Google.
Le Qwen3.7-Max s’est classé quatrième dans le dernier classement WebDev de Code Arena, derrière plusieurs modèles Claude d’Anthropic, tout en devançant les modèles référencés de deux des laboratoires américains d’IA les plus suivis. Ce résultat offre à Alibaba une rare place dans le top 5 d’un benchmark qui évalue la capacité des modèles d’IA à créer des applications web, et pas seulement à répondre à des requêtes de programmation.
Ce résultat ne signifie pas qu’Alibaba a dépassé OpenAI ou Google dans l’ensemble du domaine de l’IA. Il place toutefois plus fermement les agents de codage et les outils pour développeurs au cœur de la course mondiale à l’IA.
Alibaba gagne du terrain dans le codage par IA
Le Qwen3.7-Max a obtenu un score de 1 541 et s’est classé quatrième dans le dernier classement des modèles de codage de Code Arena, a rapporté le South China Morning Post.
Le média a indiqué que le modèle avait devancé ceux d’OpenAI et Google. Le SCMP a également relevé que les modèles Claude d’Anthropic occupaient les autres places du top 5, faisant d’Alibaba le seul développeur non américain de ce groupe.
Alibaba Cloud a présenté Qwen3.7-Max comme un modèle conçu pour les flux de travail pilotés par des agents, notamment le codage, l’automatisation bureautique et l’exécution de tâches de longue durée.
« Qwen3.7-Max est notre modèle le plus polyvalent et le plus performant pour les flux de travail pilotés par des agents », a écrit l’équipe de Qwen.
Code Arena se concentre sur la création d’applications réelles
Selon Tech in Asia, Code Code Arena, auparavant connu sous le nom de WebDev Arena, utilise des votes à l’aveugle sur des résultats de modèles anonymisés afin d’évaluer la capacité des systèmes d’IA à créer des applications web à partir de requêtes utilisateur.
Cette approche diffère des benchmarks de codage traditionnels tels que HumanEval ou SWE-bench, qui reposent sur des tests standardisés. Code Arena est conçu pour refléter la manière dont les développeurs évaluent les résultats d’un modèle lors de la création d’applications web interactives et d’autres logiciels de type produit.
Le benchmark s’est étendu au-delà des simples pages HTML et composants front-end pour inclure des applications React composées de plusieurs fichiers, des tableaux de bord, des jeux sur navigateur et d’autres tâches de développement de logiciels de type produit.
Qwen investit les outils pour développeurs
Alibaba a connecté les capacités de codage de Qwen à Qwen Code, un agent open source pour terminal. Tech in Asia a souligné que Qwen Code pouvait accéder aux API ModelStudio d’Alibaba Cloud et s’intégrer aux environnements de développement, aux flux de travail CI/CD et aux services HTTP.
Alibaba Cloud a également présenté Qwen3.7-Max comme un modèle conçu pour les flux de travail pilotés par des agents, notamment le codage, l’automatisation bureautique et l’exécution de tâches de longue durée.
Alibaba dispose désormais d’un autre moyen de se disputer les développeurs, alors que les outils de codage par IA vont au-delà de la complétion de code pour s’intégrer à des flux de travail logiciels plus vastes. Le résultat de Code Arena ne constitue qu’un benchmark parmi d’autres, et les classements peuvent évoluer rapidement, mais la place obtenue par Qwen3.7-Max montre que la concurrence mondiale dans le codage par IA s’étend au-delà d’OpenAI, de Google et d’Anthropic.
À lire aussi : Google déploie de nouveaux outils de codage par IA alors que l’entreprise cherche à concurrencer Anthropic et OpenAI dans le développement logiciel.


