ARC-AGI-3

ARC-AGI-3 est la troisième génération de l’Abstraction and Reasoning Corpus, conçue par l’ARC Prize Foundation. Ce benchmark place les modèles face à des tâches agentiques interactives dans des environnements visuels nouveaux, indépendamment de la langue naturelle.

ARC-AGI-3 est la troisième génération de l’Abstraction and Reasoning Corpus, conçue par l’ARC Prize Foundation. Ce benchmark place les modèles face à des tâches agentiques interactives dans des environnements visuels nouveaux, indépendamment de la langue naturelle.

L’évaluation cible le raisonnement abstrait fluide, l’exploration, la planification et l’adaptation. Elle sert à apprécier la capacité des modèles à découvrir des règles et à résoudre des problèmes inédits, dans un domaine qui reste loin d’être saturé par les modèles de pointe.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkARC Prize Foundation
Capacités mesuréesgénéraliste, raisonnement
ModalitéMultimodal
Type de questionstâches agentiques interactives dans des environnements visuels
Métrique d'évaluationscore normalisé moyen
AccèsJeu de test privé (réponses non divulguées)
Languesindépendant de la langue naturelle (tâches visuelles interactives)

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (4)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Opus 5Anthropic🔒 Propriétaire30,2 %24 juillet 2026Auto-déclaré
2GPT-5.6 SolOpenAI🔒 Propriétaire7,8 %9 juillet 2026Auto-déclaré
3GPT-5.6 TerraOpenAI🔒 Propriétaire0,8 %9 juillet 2026Auto-déclaré
4GPT-5.6 LunaOpenAI🔒 Propriétaire0,2 %9 juillet 2026Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 4,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle parvient régulièrement à explorer un environnement inconnu, à en inférer les mécanismes, à planifier ses actions et à adapter sa stratégie. Le score normalisé moyen synthétise cette performance sur l’ensemble des tâches. La rigueur du protocole bénéficie d’un jeu de test privé dont les réponses ne sont pas divulguées, ce qui réduit le risque d’exposition directe aux solutions. La fiabilité comparative reste toutefois à nuancer, car les résultats de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés par une même autorité indépendante. ARC-AGI-3 demeure loin de la saturation, ce qui lui permet de différencier les modèles, mais sa portée reste centrée sur le raisonnement agentique dans des environnements visuels interactifs. Il ne résume donc pas à lui seul toutes les capacités d’un modèle. Parmi les quatre modèles évalués, Claude Opus 5 se détache nettement avec 30 %, tandis que la médiane de 4 % révèle des performances globalement encore faibles et un écart marqué entre le meilleur résultat et le centre du classement.


Sources des scores : llm-stats.