Gemini schlägt Claude und GPT in Googles erstem Android-KI-Coding-Benchmark

person looking at charts

Image: ChatGPT

Mar 9, 2026
3 minute read
eWeek Inhalte und Produktempfehlungen sind redaktionell unabhängig. Wir können Geld verdienen, wenn Sie auf Links zu unseren Partnern klicken. Mehr erfahren

Google hat gerade seine erste Android-Bench-Rangliste veröffentlicht, in der die KI-Modelle aufgeführt sind, die sich beim Programmieren von Android-Apps am besten schlagen. 

Neun Modelle schafften es in die Liste, darunter Tools von Google Gemini, Anthropic Claude und OpenAI. Wenig überraschend führte Gemini 3.1 Pro Preview den Benchmark mit einer Bewertung von 72,4 % an, gefolgt von Claude Opus 4.6 und GPT-5.2 Codex. 

Google entwickelte den Benchmark, um zu messen, wie gut KI-Systeme reale Probleme der Android-Entwicklung lösen, und nutzte dafür Aufgaben aus mehreren GitHub-Projekten.

Was ist Android Bench und warum ist es wichtig 

Google Developers hat Android Bench eingeführt, um eine definitive Kennzahl für die Rangfolge von KI-Tools anhand ihrer Leistung bei komplexen Android-Coding-Aufgaben bereitzustellen. Beim Benchmark wurden KI-Modelle anhand realer Probleme bewertet. Zum Einsatz kamen dabei mehr als 100 Aufgaben aus nahezu 39.000 GitHub-Pull-Requests. 

Google prüft, wie gut die Tools zentrale Bereiche der Android-Entwicklung bewältigen, etwa Jetpack Compose für Benutzeroberflächen, asynchrone Programmierung, Hilt für Dependency Injection und Room für die Persistenz. 

Außerdem wird die Leistung bei Problemen gemessen, mit denen Entwickler häufig konfrontiert sind, etwa bei Migrationen der Navigation, der Build-Konfiguration oder Änderungen durch SDK-Updates. Die Methodik deckt auch fortgeschrittene Themen wie die System-UI, Kamera, Medien, Anpassungen für faltbare Geräte und granulare Berechtigungen ab. 

Der Datenbestand stützte sich zu großen Teilen auf Java (71 %) und Kotlin (25 %), die weiterhin zu den meistgenutzten Programmiersprachen für die Android-Entwicklung gehören.

Die Gewinner der Rangliste

Es überrascht nicht, dass Googles eigenes KI-Tool an erster Stelle steht, wenn man bedenkt, wie viel Aufmerksamkeit Google dem KI-Coding offenbar widmet. Im Folgenden sind die leistungsstärksten KI-Modelle in absteigender Reihenfolge mit ihren Testergebnissen in Prozent aufgeführt:

  • Gemini 3.1 Pro Preview: 72.4%
  • Claude Opus 4.6: 66.6%
  • GPT-5.2-Codex: 62.5%
  • Claude Opus 4.5: 61.9%
  • Gemini 3 Pro Preview: 60.4%
  • Claude Sonnet 4.6: 58.4%
  • Claude Sonnet 4.5: 54.2%
  • Gemini 3 Flash Preview: 42.0%
  • Gemini 2.5 Flash: 16.1%
Advertisement

Google Developers empfahl außerdem, regelmäßig nachzusehen, ob es neue Änderungen an der Rangliste gibt.

Was bedeutet diese Rangliste für KI-Plattformen und Entwickler?

KI entwickelt sich rasant weiter und sorgt für eine explosionsartige Zunahme der Nutzung durch einzelne Entwickler und Unternehmensteams, die Kosten senken wollen. Mit einem Abonnement für einige KI-Coding-Apps erhalten Entwickler Zugriff auf verschiedene KI-Modelle, die für das Programmieren entwickelt wurden.

Dennoch blieb eine zentrale Frage unbeantwortet: Welche KI eignet sich am besten zum Programmieren, insbesondere für die Android-Entwicklung – ein Bereich, den bestehende Benchmarks laut Google Developers außer Acht lassen?

Die Ergebnisse von Android Bench klären diese Debatte umgehend und bieten Entwicklerteams eine verlässliche, begrenzte Auswahl leistungsstarker KI-Modelle. Dadurch können Teams schnell eine KI-Lösung auswählen, die ihrem Budget und ihren Präferenzen entspricht, und zugleich den Zeit- und Ressourcenaufwand für das Testen mehrerer Optionen vermeiden.

Entscheidend ist, dass der öffentliche Benchmark eine klare Wachstumschance für konkurrierende Plattformen bietet. Als bedeutender Akteur der Branche hat Google einen transparenten Standard etabliert. 

Indem Google seine Bewertungsmetrik und die Liste der GitHub-Repositories offengelegt hat, auf denen die Tests ausgeführt wurden, gab das Unternehmen anderen KI-Entwicklern eine Möglichkeit zu beurteilen, gegenüber welchem Tool sie aufholen müssen. Außerdem können diese KI-Plattformen dadurch konkrete Funktionen identifizieren, die sie selbst verbessern können.

Lesen Sie auch: Googles Gemini 3.1 Pro gewinnt an Zugkraft, während das Unternehmen verstärkt auf fortschrittliche Coding- und Reasoning-Workflows setzt.

Joseph Chisom Ofonagoro

Joseph is a Technical Writer with about 3 years of experience in the industry, also advancing a career in cyber threat intelligence. He is passionate about the responsible use of technology, a passion that led him into cybersecurity. As an undergrad, he leads a novel community of technology enthusiasts at his school, NOUN, where he guides and shares resources for beginners in tech. His writing experience includes a diverse range of topics, from consumer tech to startups to tutorials. Additionally, he periodically shares case studies and research reports on cybersecurity on his social media pages.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Eigentum von TechnologyAdvice. © 2026 TechnologyAdvice. Alle Rechte vorbehalten

Werbetreibenden-Offenlegung: Einige der auf dieser Website erscheinenden Produkte stammen von Unternehmen, von denen TechnologyAdvice eine Vergütung erhält. Diese Vergütung kann beeinflussen, wie und wo Produkte auf dieser Website erscheinen, einschließlich beispielsweise der Reihenfolge, in der sie erscheinen. TechnologyAdvice schließt nicht alle Unternehmen oder alle auf dem Marktplatz verfügbaren Produkttypen ein.