ARC-AGI
ARC-AGI est un benchmark de raisonnement abstrait créé par François Chollet en 2019. Il repose sur des tâches visuelles dans lesquelles quelques paires de grilles illustrent une transformation gouvernée par une règle implicite.
ARC-AGI est un benchmark de raisonnement abstrait créé par François Chollet en 2019. Il repose sur des tâches visuelles dans lesquelles quelques paires de grilles illustrent une transformation gouvernée par une règle implicite.
Les modèles doivent inférer cette règle à partir de très peu d’exemples, puis l’appliquer exactement à de nouvelles grilles. ARC-AGI évalue ainsi l’acquisition rapide de compétences et le raisonnement abstrait avec un minimum de connaissances préalables, plutôt que la compréhension du langage naturel.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | François Chollet |
| Capacités mesurées | raisonnement, raisonnement spatial, vision |
| Modalité | Image |
| Type de questions | tâches de transformation de grilles visuelles à partir de quelques exemples entrée-sortie |
| Métrique d'évaluation | accuracy / exact match des grilles de sortie |
| Accès | Jeu de test privé (réponses non divulguées) |
| Licence | Apache-2.0 |
| Langues | sans langue naturelle ; grilles visuelles avec couleurs/symboles |
| Taille du jeu | environ 800 tâches publiques, avec un ensemble de test privé utilisé pour l’évaluation |
| Année de publication | 2019 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 95,0 % | 23 avril 2026 | Auto-déclaré |
| 2 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 93,7 % | 5 mars 2026 | Auto-déclaré |
| 3 | GPT-5.2 Pro | OpenAI | 🔒 Propriétaire | 90,5 % | 11 décembre 2025 | Auto-déclaré |
| 4 | o3 | OpenAI | 🔒 Propriétaire | 88,0 % | 16 avril 2025 | Auto-déclaré |
| 5 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 86,2 % | 11 décembre 2025 | Auto-déclaré |
| 6 | LongCat-Flash-Thinking | Meituan | 🟢 Ouvert | 50,3 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 41,8 % | 22 juillet 2025 | Auto-déclaré |
Classement établi sur 7 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 88,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur ARC-AGI indique qu’un modèle parvient fréquemment à identifier les règles abstraites sous-jacentes et à produire exactement les grilles attendues. L’exact match impose une évaluation stricte, puisqu’une sortie doit correspondre entièrement à la solution. Le test privé, dont les réponses ne sont pas divulguées, contribue à limiter l’accès direct aux solutions. La fiabilité comparative reste toutefois à considérer avec prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun.
Avec une médiane de 88 % parmi sept modèles et un meilleur résultat de 95 % pour GPT-5.5, le classement montre des performances élevées et relativement proches du plafond. Cette concentration réduit la capacité du benchmark à départager finement les meilleurs modèles et signale un risque de saturation. Une contamination par les quelque 800 tâches publiques demeure une limite potentielle, même si l’évaluation finale utilise un ensemble privé. Enfin, ARC-AGI mesure un périmètre ciblé, celui des transformations spatiales de grilles colorées, et non l’ensemble des capacités associées à l’intelligence générale.
Sources des scores : llm-stats.