Google vient de publier le premier classement d’Android Bench, qui classe les modèles d’IA les plus performants pour coder des applications Android.
Neuf modèles figurent dans la liste, tous issus des outils de Google Gemini, d’Anthropic Claude et d’OpenAI. Sans surprise, Gemini 3.1 Pro Preview arrive en tête du benchmark avec un score de 72,4 %, suivi de Claude Opus 4.6 et de GPT-5.2 Codex.
Google a créé ce benchmark pour mesurer la capacité des systèmes d’IA à résoudre de véritables problèmes de développement Android à partir de tâches tirées de plusieurs projets GitHub.
Qu’est-ce qu’Android Bench et pourquoi est-il important
Google Developers a lancé Android Bench afin de fournir une métrique de référence pour classer les outils d’IA selon leurs performances sur des tâches complexes de codage Android. Le benchmark a évalué les modèles d’IA sur des problèmes du monde réel en utilisant plus de 100 tâches tirées de près de 39 000 pull requests GitHub.
Google vérifie la capacité des outils à gérer des domaines clés du développement Android, comme Jetpack Compose pour l’interface utilisateur, la programmation asynchrone, Hilt pour l’injection de dépendances et Room pour la persistance.
Il mesure également les performances sur des problèmes auxquels les développeurs sont fréquemment confrontés, comme les migrations de navigation, la configuration des builds ou les changements liés aux mises à jour du SDK. La méthodologie couvre aussi des sujets avancés comme l’interface système, l’appareil photo, les contenus multimédias, les adaptations aux appareils pliables et la gestion granulaire des autorisations.
L’ensemble de données reposait principalement sur Java (71 %) et Kotlin (25 %), qui restent deux des langages de programmation les plus utilisés pour le développement Android.
Les gagnants du classement
Il n’est pas surprenant que l’outil d’IA de Google soit arrivé en tête, compte tenu de l’importance que Google semble accorder au codage par IA. Voici les modèles d’IA les plus performants, classés par ordre décroissant, avec leurs scores aux tests en pourcentage :
- Gemini 3.1 Pro Preview : 72.4%
- Claude Opus 4.6 : 66.6%
- GPT-5.2-Codex : 62.5%
- Claude Opus 4.5: 61.9%
- Gemini 3 Pro Preview : 60.4%
- Claude Sonnet 4.6 : 58.4%
- Claude Sonnet 4.5 : 54.2%
- Gemini 3 Flash Preview : 42.0%
- Gemini 2.5 Flash : 16.1%
Google Developers a également recommandé aux utilisateurs de revenir régulièrement consulter les nouvelles évolutions du classement.
Que signifie ce classement pour les plateformes d’IA et les développeurs ?
L’IA progresse rapidement, ce qui entraîne une explosion de son utilisation chez les développeurs individuels et les équipes d’entreprise qui cherchent à réduire leurs coûts. Avec un simple abonnement à certaines applications de codage par IA, les développeurs accèdent à différents modèles d’IA conçus pour le codage.
Une question centrale restait pourtant sans réponse : quelle IA est la plus performante pour coder, en particulier pour le développement Android, un domaine que les benchmarks existants négligent selon Google Developers ?
Les résultats d’Android Bench tranchent immédiatement ce débat en fournissant aux équipes de développement une sélection fiable et resserrée de modèles d’IA performants. Les équipes peuvent ainsi choisir rapidement une solution d’IA adaptée à leur budget et à leurs préférences, tout en éliminant le temps et les ressources consacrés à tester plusieurs options.
Point crucial, le benchmark public offre une nette occasion de progresser aux plateformes concurrentes. En tant qu’acteur majeur du secteur, Google a établi une référence transparente.
En laissant accessibles leur métrique d’évaluation et la liste des dépôts GitHub sur lesquels les tests ont été exécutés, les créateurs d’autres outils d’IA disposent d’un moyen d’évaluer le niveau qu’ils doivent atteindre. Cela permet également à ces plateformes d’IA d’identifier les fonctionnalités spécifiques qu’elles peuvent améliorer par elles-mêmes.
À lire également : Le Gemini 3.1 Pro de Google gagne du terrain alors que l’entreprise mise davantage sur les workflows avancés de codage et de raisonnement.


