La ARC Prize Foundation a présenté ce mois-ci la toute dernière version de son benchmark populaire : ARC-AGI-2 (également connu sous le nom d’Abstraction and Reasoning Corpus). Ce dernier test de référence est encore plus exigeant que l’original, baptisé ARC-AGI-1, lancé en 2019.
Selon Greg Kamradt, président de la Arc Prize Foundation, « ARC-AGI-2 relève considérablement la barre pour l’IA. »
Examen des premiers scores
Le benchmark ARC-AGI-2 se compose d’une série d’énigmes à résoudre par l’IA. Après avoir soumis le test à plus de 400 personnes, la ARC Prize Foundation a établi une référence humaine pour ses évaluations.
- Panel humain : 60 % en moyenne, pour un coût de 17 dollars US par tâche.
Les outils d’IA générative actuels, en revanche, s’en sont beaucoup moins bien sortis.
- OpenAI o1-pro : 1 % avec un coût de 200 dollars US par tâche.
- OpenAI o3-mini-high : 0,0 % avec un coût de 0,41 dollar US par tâche.
- OpenAI GPT-4.5 : 0,0 % avec un coût de 0,29 dollar US par tâche.
- DeepSeek-R1 et R1-Zero : 0,3 % avec un coût de 0,08 dollar US par tâche.
- Anthropic Claude 3.7 : 0,0 % avec un coût de 0,120 dollar US par tâche.
- Google Gemini 2.0 Flash : 1,3 % avec un coût de 0,004 dollar US par tâche.
Le panel humain a largement surpassé les grands modèles de langage (LLM) et les systèmes d’IA évalués avec ARC-AGI-2. Mais sur quels jeux de données les tests se sont-ils appuyés ?
Analyse des jeux de données
Le benchmark ARC-AGI-2 comprend au total quatre jeux de données.
- Entraînement : 1 000 tâches publiques non calibrées.
- Évaluation publique : 120 tâches publiques calibrées.
- Évaluation semi-privée : 120 tâches privées calibrées.
- Évaluation privée : 120 tâches privées calibrées.
Les tâches sont considérées comme calibrées lorsqu’elles sont indépendantes et distribuées de manière identique. Cette approche de calibration, comme l’a expliqué TechCrunch, garantit que les scores obtenus sur ces jeux de données restent directement comparables.
ARC Prize 2025 : le grand prix s’élève à 700 000 dollars US
Mars 2025 a également été marqué par l’annonce de l’ARC Prize 2025, qui repose sur les benchmarks et les jeux de données d’ARC-AGI-2. Dotée d’un grand prix de 700 000 dollars US, la compétition met les développeurs d’IA au défi d’atteindre un taux de précision de 85 % sur le jeu de données d’évaluation privée d’ARC-AGI-2.
Pour être éligibles, les types de modèles d’IA participant au concours ne peuvent pas dépenser plus de 0,42 dollar US par tâche. En outre, ils doivent effectuer l’évaluation sans accès à Internet.
Les participants à l’ARC Prize 2025 doivent avoir finalisé leur soumission d’ici au 3 novembre 2025. Les chercheurs peuvent également soumettre des livres blancs pour tenter de remporter un grand prix de 75 000 dollars US. La date limite de soumission des articles est fixée au 9 novembre 2025.
Le modèle d’IA qui obtient le meilleur score sur le jeu de données d’évaluation privée sera déclaré vainqueur. Les articles soumis sont évalués selon une grille standardisée.

