ARC-AGI-3
ARC-AGI-3 est la troisième génération de l’Abstraction and Reasoning Corpus, conçue par l’ARC Prize Foundation. Ce benchmark place les modèles face à des tâches agentiques interactives dans des environnements visuels nouveaux, indépendamment de la langue naturelle.
ARC-AGI-3 est la troisième génération de l’Abstraction and Reasoning Corpus, conçue par l’ARC Prize Foundation. Ce benchmark place les modèles face à des tâches agentiques interactives dans des environnements visuels nouveaux, indépendamment de la langue naturelle.
L’évaluation cible le raisonnement abstrait fluide, l’exploration, la planification et l’adaptation. Elle sert à apprécier la capacité des modèles à découvrir des règles et à résoudre des problèmes inédits, dans un domaine qui reste loin d’être saturé par les modèles de pointe.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | ARC Prize Foundation |
| Capacités mesurées | généraliste, raisonnement |
| Modalité | Multimodal |
| Type de questions | tâches agentiques interactives dans des environnements visuels |
| Métrique d'évaluation | score normalisé moyen |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | indépendant de la langue naturelle (tâches visuelles interactives) |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (4)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 🔒 Propriétaire | 30,2 % | 24 juillet 2026 | Auto-déclaré |
| 2 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 7,8 % | 9 juillet 2026 | Auto-déclaré |
| 3 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 0,8 % | 9 juillet 2026 | Auto-déclaré |
| 4 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 0,2 % | 9 juillet 2026 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 4,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle parvient régulièrement à explorer un environnement inconnu, à en inférer les mécanismes, à planifier ses actions et à adapter sa stratégie. Le score normalisé moyen synthétise cette performance sur l’ensemble des tâches. La rigueur du protocole bénéficie d’un jeu de test privé dont les réponses ne sont pas divulguées, ce qui réduit le risque d’exposition directe aux solutions. La fiabilité comparative reste toutefois à nuancer, car les résultats de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés par une même autorité indépendante. ARC-AGI-3 demeure loin de la saturation, ce qui lui permet de différencier les modèles, mais sa portée reste centrée sur le raisonnement agentique dans des environnements visuels interactifs. Il ne résume donc pas à lui seul toutes les capacités d’un modèle. Parmi les quatre modèles évalués, Claude Opus 5 se détache nettement avec 30 %, tandis que la médiane de 4 % révèle des performances globalement encore faibles et un écart marqué entre le meilleur résultat et le centre du classement.
Sources des scores : llm-stats.