ARC-AGI

ARC-AGI est un benchmark de raisonnement abstrait créé par François Chollet en 2019. Il repose sur des tâches visuelles dans lesquelles quelques paires de grilles illustrent une transformation gouvernée par une règle implicite.

ARC-AGI est un benchmark de raisonnement abstrait créé par François Chollet en 2019. Il repose sur des tâches visuelles dans lesquelles quelques paires de grilles illustrent une transformation gouvernée par une règle implicite.

Les modèles doivent inférer cette règle à partir de très peu d’exemples, puis l’appliquer exactement à de nouvelles grilles. ARC-AGI évalue ainsi l’acquisition rapide de compétences et le raisonnement abstrait avec un minimum de connaissances préalables, plutôt que la compréhension du langage naturel.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkFrançois Chollet
Capacités mesuréesraisonnement, raisonnement spatial, vision
ModalitéImage
Type de questionstâches de transformation de grilles visuelles à partir de quelques exemples entrée-sortie
Métrique d'évaluationaccuracy / exact match des grilles de sortie
AccèsJeu de test privé (réponses non divulguées)
LicenceApache-2.0
Languessans langue naturelle ; grilles visuelles avec couleurs/symboles
Taille du jeuenviron 800 tâches publiques, avec un ensemble de test privé utilisé pour l’évaluation
Année de publication2019
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.5OpenAI🔒 Propriétaire95,0 %23 avril 2026Auto-déclaré
2GPT-4.5OpenAI🔒 Propriétaire93,7 %5 mars 2026Auto-déclaré
3GPT-5.2 ProOpenAI🔒 Propriétaire90,5 %11 décembre 2025Auto-déclaré
4o3OpenAI🔒 Propriétaire88,0 %16 avril 2025Auto-déclaré
5GPT-5.2OpenAI🔒 Propriétaire86,2 %11 décembre 2025Auto-déclaré
6LongCat-Flash-ThinkingMeituan🟢 Ouvert50,3 %22 septembre 2025Auto-déclaré
7Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert41,8 %22 juillet 2025Auto-déclaré

Classement établi sur 7 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 88,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur ARC-AGI indique qu’un modèle parvient fréquemment à identifier les règles abstraites sous-jacentes et à produire exactement les grilles attendues. L’exact match impose une évaluation stricte, puisqu’une sortie doit correspondre entièrement à la solution. Le test privé, dont les réponses ne sont pas divulguées, contribue à limiter l’accès direct aux solutions. La fiabilité comparative reste toutefois à considérer avec prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun.

Avec une médiane de 88 % parmi sept modèles et un meilleur résultat de 95 % pour GPT-5.5, le classement montre des performances élevées et relativement proches du plafond. Cette concentration réduit la capacité du benchmark à départager finement les meilleurs modèles et signale un risque de saturation. Une contamination par les quelque 800 tâches publiques demeure une limite potentielle, même si l’évaluation finale utilise un ensemble privé. Enfin, ARC-AGI mesure un périmètre ciblé, celui des transformations spatiales de grilles colorées, et non l’ensemble des capacités associées à l’intelligence générale.


Sources des scores : llm-stats.