Gemini devance Claude et GPT dans le premier benchmark de Google sur le codage Android par IA

person looking at charts

Image: ChatGPT

Mar 9, 2026
3 minute read
eWeek Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

Google vient de publier le premier classement d’Android Bench, qui classe les modèles d’IA les plus performants pour coder des applications Android. 

Neuf modèles figurent dans la liste, tous issus des outils de Google Gemini, d’Anthropic Claude et d’OpenAI. Sans surprise, Gemini 3.1 Pro Preview arrive en tête du benchmark avec un score de 72,4 %, suivi de Claude Opus 4.6 et de GPT-5.2 Codex. 

Google a créé ce benchmark pour mesurer la capacité des systèmes d’IA à résoudre de véritables problèmes de développement Android à partir de tâches tirées de plusieurs projets GitHub.

Qu’est-ce qu’Android Bench et pourquoi est-il important 

Google Developers a lancé Android Bench afin de fournir une métrique de référence pour classer les outils d’IA selon leurs performances sur des tâches complexes de codage Android. Le benchmark a évalué les modèles d’IA sur des problèmes du monde réel en utilisant plus de 100 tâches tirées de près de 39 000 pull requests GitHub. 

Google vérifie la capacité des outils à gérer des domaines clés du développement Android, comme Jetpack Compose pour l’interface utilisateur, la programmation asynchrone, Hilt pour l’injection de dépendances et Room pour la persistance. 

Il mesure également les performances sur des problèmes auxquels les développeurs sont fréquemment confrontés, comme les migrations de navigation, la configuration des builds ou les changements liés aux mises à jour du SDK. La méthodologie couvre aussi des sujets avancés comme l’interface système, l’appareil photo, les contenus multimédias, les adaptations aux appareils pliables et la gestion granulaire des autorisations. 

L’ensemble de données reposait principalement sur Java (71 %) et Kotlin (25 %), qui restent deux des langages de programmation les plus utilisés pour le développement Android.

Advertisement

Les gagnants du classement

Il n’est pas surprenant que l’outil d’IA de Google soit arrivé en tête, compte tenu de l’importance que Google semble accorder au codage par IA. Voici les modèles d’IA les plus performants, classés par ordre décroissant, avec leurs scores aux tests en pourcentage :

  • Gemini 3.1 Pro Preview : 72.4%
  • Claude Opus 4.6 : 66.6%
  • GPT-5.2-Codex : 62.5%
  • Claude Opus 4.5: 61.9%
  • Gemini 3 Pro Preview : 60.4%
  • Claude Sonnet 4.6 : 58.4%
  • Claude Sonnet 4.5 : 54.2%
  • Gemini 3 Flash Preview : 42.0%
  • Gemini 2.5 Flash : 16.1%

Google Developers a également recommandé aux utilisateurs de revenir régulièrement consulter les nouvelles évolutions du classement.

Que signifie ce classement pour les plateformes d’IA et les développeurs ?

L’IA progresse rapidement, ce qui entraîne une explosion de son utilisation chez les développeurs individuels et les équipes d’entreprise qui cherchent à réduire leurs coûts. Avec un simple abonnement à certaines applications de codage par IA, les développeurs accèdent à différents modèles d’IA conçus pour le codage.

Une question centrale restait pourtant sans réponse : quelle IA est la plus performante pour coder, en particulier pour le développement Android, un domaine que les benchmarks existants négligent selon Google Developers ?

Les résultats d’Android Bench tranchent immédiatement ce débat en fournissant aux équipes de développement une sélection fiable et resserrée de modèles d’IA performants. Les équipes peuvent ainsi choisir rapidement une solution d’IA adaptée à leur budget et à leurs préférences, tout en éliminant le temps et les ressources consacrés à tester plusieurs options.

Advertisement

Point crucial, le benchmark public offre une nette occasion de progresser aux plateformes concurrentes. En tant qu’acteur majeur du secteur, Google a établi une référence transparente. 

En laissant accessibles leur métrique d’évaluation et la liste des dépôts GitHub sur lesquels les tests ont été exécutés, les créateurs d’autres outils d’IA disposent d’un moyen d’évaluer le niveau qu’ils doivent atteindre. Cela permet également à ces plateformes d’IA d’identifier les fonctionnalités spécifiques qu’elles peuvent améliorer par elles-mêmes.

À lire également : Le Gemini 3.1 Pro de Google gagne du terrain alors que l’entreprise mise davantage sur les workflows avancés de codage et de raisonnement.

Joseph Chisom Ofonagoro

Joseph is a Technical Writer with about 3 years of experience in the industry, also advancing a career in cyber threat intelligence. He is passionate about the responsible use of technology, a passion that led him into cybersecurity. As an undergrad, he leads a novel community of technology enthusiasts at his school, NOUN, where he guides and shares resources for beginners in tech. His writing experience includes a diverse range of topics, from consumer tech to startups to tutorials. Additionally, he periodically shares case studies and research reports on cybersecurity on his social media pages.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.