ARC-AGI v2

ARC-AGI v2 est un benchmark de raisonnement abstrait créé en 2025 par l’ARC Prize Foundation, notamment François Chollet, Mike Knoop et Gregory Kamradt. Il repose sur des grilles visuelles colorées dont il faut déduire la règle de transformation à partir de quelques paires entrée-sortie.

ARC-AGI v2 est un benchmark de raisonnement abstrait créé en 2025 par l’ARC Prize Foundation, notamment François Chollet, Mike Knoop et Gregory Kamradt. Il repose sur des grilles visuelles colorées dont il faut déduire la règle de transformation à partir de quelques paires entrée-sortie.

Conçu pour évaluer l’intelligence fluide, il teste la capacité à généraliser face à des problèmes inédits. Il cible notamment le raisonnement spatial, la reconnaissance de motifs et la généralisation compositionnelle, sans dépendre du langage.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkARC Prize Foundation (François Chollet, Mike Knoop, Gregory Kamradt et al.)
Capacités mesuréesIntelligence fluide et raisonnement abstrait : généralisation à partir de très peu d'exemples sur des transformations de grilles inédites.
ModalitéMultimodal
Type de questionsTâches de raisonnement abstrait sur grilles visuelles (paires entrée-sortie)
Métrique d'évaluationExactitude : grille de sortie exacte sur toutes les entrées de test, jusqu'à 2 essais (pass@2)
AccèsPublic
LicenceApache-2.0
LanguesN/A (grilles visuelles, sans langage)
Taille du jeu1000 tâches d'entraînement, 120 tâches d'évaluation publique (+ ensemble de test privé)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (16)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.5OpenAI🔒 Propriétaire85,0 %23 avril 2026Auto-déclaré
2Gemini 3.1 Pro PreviewGoogle▫ n.d.77,1 %19 février 2026Auto-déclaré
3GPT-4.5OpenAI🔒 Propriétaire73,3 %5 mars 2026Auto-déclaré
4Gemini 3.5 FlashGoogle🔒 Propriétaire72,1 %19 mai 2026Auto-déclaré
5Claude Opus 4.6Anthropic🔒 Propriétaire68,8 %5 février 2026Auto-déclaré
6Claude Sonnet 4.6Anthropic🔒 Propriétaire58,3 %17 février 2026Auto-déclaré
7GPT-5.2 ProOpenAI🔒 Propriétaire54,2 %11 décembre 2025Auto-déclaré
8GPT-5.2OpenAI🔒 Propriétaire52,9 %11 décembre 2025Auto-déclaré
9Muse SparkMeta🔒 Propriétaire42,5 %8 avril 2026Auto-déclaré
10Claude Opus 4.5Anthropic🔒 Propriétaire37,6 %24 novembre 2025Auto-déclaré
11Gemini 3 FlashGoogle🔒 Propriétaire33,6 %17 décembre 2025Auto-déclaré
12Gemini 3 ProGoogle🔒 Propriétaire31,1 %18 novembre 2025Auto-déclaré
13Grok-4xAI🔒 Propriétaire15,9 %9 juillet 2025Auto-déclaré
14Claude Opus 4Anthropic🔒 Propriétaire8,6 %22 mai 2025n.d.
15o3OpenAI🔒 Propriétaire6,5 %16 avril 2025n.d.
16Gemini 2.5 ProGoogle🔒 Propriétaire4,9 %20 mai 2025n.d.

Classement établi sur 16 modèles évalués, dont 16 de grands éditeurs. Score médian de l'ensemble : 47,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur ARC-AGI v2 signifie qu’un modèle parvient fréquemment à produire une grille entièrement exacte pour toutes les entrées de test, avec au plus deux essais. Cette exigence stricte valorise l’identification de règles, leur composition et leur application précise, plutôt qu’une réponse partiellement correcte. Dans la base, l’écart entre le score médian de 48 % et les 85 % de GPT-5.5 montre une forte différenciation entre modèles. Le meilleur résultat restant inférieur à un score parfait, le benchmark ne paraît pas saturé dans cet ensemble. L’interprétation du classement demande toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant unique. L’évaluation publique peut aussi être exposée à un risque de contamination, tandis que l’ensemble privé contribue à contrôler ce risque. Enfin, ARC-AGI v2 mesure une portée cognitive ciblée, le raisonnement abstrait sur grilles visuelles. Ses résultats ne résument donc pas l’ensemble des capacités générales, linguistiques ou spécialisées d’un modèle.


Sources des scores : llm-stats.