ARC-C

ARC-C est un benchmark de questions scientifiques à choix multiples de niveau scolaire, créé en 2018 par AI2 (Allen Institute for AI), Peter Clark et ses coauteurs. Il constitue la partie difficile de l’AI2 Reasoning Challenge.

ARC-C est un benchmark de questions scientifiques à choix multiples de niveau scolaire, créé en 2018 par AI2 (Allen Institute for AI), Peter Clark et ses coauteurs. Il constitue la partie difficile de l’AI2 Reasoning Challenge.

Les questions retenues ont mis en échec des algorithmes fondés sur la recherche d’information et la cooccurrence de mots. ARC-C sert ainsi à évaluer le raisonnement scientifique, le bon sens et la capacité des modèles à résoudre des questions exigeant davantage qu’une simple association lexicale.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAI2 (Allen Institute for AI), Peter Clark et al.
Capacités mesuréesgénéraliste, raisonnement
ModalitéTexte
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsPublic
LicenceCC-BY-SA-4.0
Languesanglais
Taille du jeu2 590 questions pour ARC-Challenge (1 119 train, 299 validation, 1 172 test)
Année de publication2018
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (34)

#ModèleÉditeurLicenceScoreSortieFiabilité
1MiMo-V2.5-ProXiaomi🟢 Ouvert97,2 %27 avril 2026Auto-déclaré
2Llama 3.1 405B InstructMeta🟢 Ouvert96,9 %23 juillet 2024Auto-déclaré
3Claude 3 OpusAnthropic🔒 Propriétaire96,4 %29 février 2024Auto-déclaré
4Llama 3.1 70B InstructMeta🟢 Ouvert94,8 %23 juillet 2024Auto-déclaré
5Nova ProAmazon🔒 Propriétaire94,8 %20 novembre 2024Auto-déclaré
6Claude 3 SonnetAnthropic🔒 Propriétaire93,2 %29 février 2024Auto-déclaré
7Jamba 1.5 LargeAI21 Labs🟢 Ouvert93,0 %22 août 2024Auto-déclaré
8Nova LiteAmazon🔒 Propriétaire92,4 %20 novembre 2024Auto-déclaré
9Mistral Small 3 24B BaseMistral AI🟢 Ouvert91,3 %30 janvier 2025Auto-déclaré
10Phi-3.5-MoE-instructMicrosoft🟢 Ouvert91,0 %23 août 2024Auto-déclaré
11Nova MicroAmazon🔒 Propriétaire90,2 %20 novembre 2024Auto-déclaré
12Claude 3 HaikuAnthropic🔒 Propriétaire89,2 %13 mars 2024Auto-déclaré
13Jamba 1.5 MiniAI21 Labs🟢 Ouvert85,7 %22 août 2024Auto-déclaré
14Phi-3.5-mini-instructMicrosoft🟢 Ouvert84,6 %23 août 2024Auto-déclaré
15Phi 4 MiniMicrosoft🟢 Ouvert83,7 %30 avril 2025Auto-déclaré
16Llama 3.1 8B InstructMeta🟢 Ouvert83,4 %23 juillet 2024Auto-déclaré
17Llama 3.2 3B InstructMeta🟢 Ouvert78,6 %25 septembre 2024Auto-déclaré
18Ministral 8B InstructMistral AI🟢 Ouvert71,9 %16 octobre 2024Auto-déclaré
19Gemma 2 27BGoogle🟢 Ouvert71,4 %27 juin 2024Auto-déclaré
20Cohere: Command R (08-2024)Cohere🟢 Ouvert71,0 %30 août 2024Auto-déclaré
21Qwen2.5-Coder 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,5 %19 septembre 2024Auto-déclaré
22Qwen2.5 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,4 %19 septembre 2024Auto-déclaré
23Llama 3.1 Nemotron 70B InstructNVIDIA🟢 Ouvert69,2 %1 octobre 2024Auto-déclaré
24Qwen2 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert68,9 %23 juillet 2024Auto-déclaré
25Gemma 2 9BGoogle🟢 Ouvert68,4 %27 juin 2024Auto-déclaré
26Qwen2.5 14B InstructAlibaba Cloud / Qwen Team🟢 Ouvert67,3 %19 septembre 2024Auto-déclaré
27Hermes 3 70BNous Research🟢 Ouvert65,5 %15 août 2024Auto-déclaré
28Gemma 3n E4BGoogle🔒 Propriétaire61,6 %26 juin 2025Auto-déclaré
29Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert61,6 %20 mai 2025Auto-déclaré
30Qwen2.5-Coder 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert60,9 %19 septembre 2024Auto-déclaré
31Gemma 3n E2BGoogle🔒 Propriétaire51,7 %26 juin 2025Auto-déclaré
32Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert51,7 %20 mai 2025Auto-déclaré
33Granite 3.3 8B BaseIBM🟢 Ouvert50,8 %16 avril 2025Auto-déclaré
34ERNIE 4.5Baidu🔒 Propriétaire40,6 %25 juin 2025Auto-déclaré

Classement établi sur 34 modèles évalués, dont 22 de grands éditeurs. Score médian de l'ensemble : 75,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur ARC-C indique qu’un modèle répond correctement à une forte proportion de QCM scientifiques difficiles et mobilise efficacement raisonnement scolaire et connaissances de bon sens. Dans la base, la médiane de 75 % et le résultat de 97 % obtenu par MiMo-V2.5-Pro montrent un niveau globalement élevé, avec un écart encore visible entre le centre du classement et son sommet. La proximité du meilleur score avec le maximum suggère toutefois une saturation progressive, susceptible de réduire le pouvoir discriminant du benchmark parmi les systèmes les plus performants.

L’interprétation du classement exige aussi de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une évaluation indépendante uniforme. L’accès public au jeu impose également de considérer un risque d’exposition préalable aux questions. Enfin, ARC-C porte uniquement sur des QCM en anglais, centrés sur les sciences de niveau scolaire et le raisonnement de bon sens. Il éclaire donc une capacité ciblée, sans résumer à lui seul les performances générales d’un modèle.


Sources des scores : llm-stats.