ARC-C
ARC-C est un benchmark de questions scientifiques à choix multiples de niveau scolaire, créé en 2018 par AI2 (Allen Institute for AI), Peter Clark et ses coauteurs. Il constitue la partie difficile de l’AI2 Reasoning Challenge.
ARC-C est un benchmark de questions scientifiques à choix multiples de niveau scolaire, créé en 2018 par AI2 (Allen Institute for AI), Peter Clark et ses coauteurs. Il constitue la partie difficile de l’AI2 Reasoning Challenge.
Les questions retenues ont mis en échec des algorithmes fondés sur la recherche d’information et la cooccurrence de mots. ARC-C sert ainsi à évaluer le raisonnement scientifique, le bon sens et la capacité des modèles à résoudre des questions exigeant davantage qu’une simple association lexicale.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | AI2 (Allen Institute for AI), Peter Clark et al. |
| Capacités mesurées | généraliste, raisonnement |
| Modalité | Texte |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Licence | CC-BY-SA-4.0 |
| Langues | anglais |
| Taille du jeu | 2 590 questions pour ARC-Challenge (1 119 train, 299 validation, 1 172 test) |
| Année de publication | 2018 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (34)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 97,2 % | 27 avril 2026 | Auto-déclaré |
| 2 | Llama 3.1 405B Instruct | Meta | 🟢 Ouvert | 96,9 % | 23 juillet 2024 | Auto-déclaré |
| 3 | Claude 3 Opus | Anthropic | 🔒 Propriétaire | 96,4 % | 29 février 2024 | Auto-déclaré |
| 4 | Llama 3.1 70B Instruct | Meta | 🟢 Ouvert | 94,8 % | 23 juillet 2024 | Auto-déclaré |
| 5 | Nova Pro | Amazon | 🔒 Propriétaire | 94,8 % | 20 novembre 2024 | Auto-déclaré |
| 6 | Claude 3 Sonnet | Anthropic | 🔒 Propriétaire | 93,2 % | 29 février 2024 | Auto-déclaré |
| 7 | Jamba 1.5 Large | AI21 Labs | 🟢 Ouvert | 93,0 % | 22 août 2024 | Auto-déclaré |
| 8 | Nova Lite | Amazon | 🔒 Propriétaire | 92,4 % | 20 novembre 2024 | Auto-déclaré |
| 9 | Mistral Small 3 24B Base | Mistral AI | 🟢 Ouvert | 91,3 % | 30 janvier 2025 | Auto-déclaré |
| 10 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 91,0 % | 23 août 2024 | Auto-déclaré |
| 11 | Nova Micro | Amazon | 🔒 Propriétaire | 90,2 % | 20 novembre 2024 | Auto-déclaré |
| 12 | Claude 3 Haiku | Anthropic | 🔒 Propriétaire | 89,2 % | 13 mars 2024 | Auto-déclaré |
| 13 | Jamba 1.5 Mini | AI21 Labs | 🟢 Ouvert | 85,7 % | 22 août 2024 | Auto-déclaré |
| 14 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 84,6 % | 23 août 2024 | Auto-déclaré |
| 15 | Phi 4 Mini | Microsoft | 🟢 Ouvert | 83,7 % | 30 avril 2025 | Auto-déclaré |
| 16 | Llama 3.1 8B Instruct | Meta | 🟢 Ouvert | 83,4 % | 23 juillet 2024 | Auto-déclaré |
| 17 | Llama 3.2 3B Instruct | Meta | 🟢 Ouvert | 78,6 % | 25 septembre 2024 | Auto-déclaré |
| 18 | Ministral 8B Instruct | Mistral AI | 🟢 Ouvert | 71,9 % | 16 octobre 2024 | Auto-déclaré |
| 19 | Gemma 2 27B | 🟢 Ouvert | 71,4 % | 27 juin 2024 | Auto-déclaré | |
| 20 | Cohere: Command R (08-2024) | Cohere | 🟢 Ouvert | 71,0 % | 30 août 2024 | Auto-déclaré |
| 21 | Qwen2.5-Coder 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,5 % | 19 septembre 2024 | Auto-déclaré |
| 22 | Qwen2.5 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,4 % | 19 septembre 2024 | Auto-déclaré |
| 23 | Llama 3.1 Nemotron 70B Instruct | NVIDIA | 🟢 Ouvert | 69,2 % | 1 octobre 2024 | Auto-déclaré |
| 24 | Qwen2 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,9 % | 23 juillet 2024 | Auto-déclaré |
| 25 | Gemma 2 9B | 🟢 Ouvert | 68,4 % | 27 juin 2024 | Auto-déclaré | |
| 26 | Qwen2.5 14B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,3 % | 19 septembre 2024 | Auto-déclaré |
| 27 | Hermes 3 70B | Nous Research | 🟢 Ouvert | 65,5 % | 15 août 2024 | Auto-déclaré |
| 28 | Gemma 3n E4B | 🔒 Propriétaire | 61,6 % | 26 juin 2025 | Auto-déclaré | |
| 29 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 61,6 % | 20 mai 2025 | Auto-déclaré | |
| 30 | Qwen2.5-Coder 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,9 % | 19 septembre 2024 | Auto-déclaré |
| 31 | Gemma 3n E2B | 🔒 Propriétaire | 51,7 % | 26 juin 2025 | Auto-déclaré | |
| 32 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 51,7 % | 20 mai 2025 | Auto-déclaré | |
| 33 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 50,8 % | 16 avril 2025 | Auto-déclaré |
| 34 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 40,6 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 34 modèles évalués, dont 22 de grands éditeurs. Score médian de l'ensemble : 75,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur ARC-C indique qu’un modèle répond correctement à une forte proportion de QCM scientifiques difficiles et mobilise efficacement raisonnement scolaire et connaissances de bon sens. Dans la base, la médiane de 75 % et le résultat de 97 % obtenu par MiMo-V2.5-Pro montrent un niveau globalement élevé, avec un écart encore visible entre le centre du classement et son sommet. La proximité du meilleur score avec le maximum suggère toutefois une saturation progressive, susceptible de réduire le pouvoir discriminant du benchmark parmi les systèmes les plus performants.
L’interprétation du classement exige aussi de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une évaluation indépendante uniforme. L’accès public au jeu impose également de considérer un risque d’exposition préalable aux questions. Enfin, ARC-C porte uniquement sur des QCM en anglais, centrés sur les sciences de niveau scolaire et le raisonnement de bon sens. Il éclaire donc une capacité ciblée, sans résumer à lui seul les performances générales d’un modèle.
Sources des scores : llm-stats.