ARC-E

ARC-E est le sous-ensemble facile du AI2 Reasoning Challenge, créé par l’Allen Institute for Artificial Intelligence (AI2) et Peter Clark et al. Il rassemble des QCM scientifiques en anglais de niveau scolaire, conçus pour mobiliser des connaissances et des capacités de raisonnement.

ARC-E est le sous-ensemble facile du AI2 Reasoning Challenge, créé par l’Allen Institute for Artificial Intelligence (AI2) et Peter Clark et al. Il rassemble des QCM scientifiques en anglais de niveau scolaire, conçus pour mobiliser des connaissances et des capacités de raisonnement.

Le benchmark évalue notamment le rappel de faits, la compréhension des questions et le raisonnement élémentaire. Ses questions pouvant être résolues par des méthodes de recherche d’information et de cooccurrence de mots, il constitue un test accessible des compétences scientifiques générales des modèles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAllen Institute for Artificial Intelligence (AI2), Peter Clark et al.
Capacités mesuréesgénéraliste, raisonnement
ModalitéTexte
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsPublic
LicenceCC BY-SA 4.0
Languesanglais
Taille du jeu5 197 questions
Année de publication2018
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (8)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemma 2 27BGoogle🟢 Ouvert88,6 %27 juin 2024Auto-déclaré
2Gemma 2 9BGoogle🟢 Ouvert88,0 %27 juin 2024Auto-déclaré
3Hermes 3 70BNous Research🟢 Ouvert83,0 %15 août 2024Auto-déclaré
4Gemma 3n E4BGoogle🔒 Propriétaire81,6 %26 juin 2025Auto-déclaré
5Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert81,6 %20 mai 2025Auto-déclaré
6Gemma 3n E2BGoogle🔒 Propriétaire75,8 %26 juin 2025Auto-déclaré
7Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert75,8 %20 mai 2025Auto-déclaré
8ERNIE 4.5Baidu🔒 Propriétaire60,7 %25 juin 2025Auto-déclaré

Classement établi sur 8 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 81,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur ARC-E indique qu’un modèle répond correctement à une forte proportion de QCM scientifiques scolaires, en combinant rappel factuel, compréhension et raisonnement élémentaire. Cette performance doit toutefois être interprétée dans le périmètre du sous-ensemble facile, dont les questions sont accessibles à des algorithmes fondés sur la recherche d’information ou les cooccurrences lexicales. Une médiane de 82 % parmi les huit modèles évalués suggère un benchmark déjà relativement saturé dans cette sélection, ce qui peut limiter sa capacité à départager finement les systèmes les plus performants. Le caractère public du jeu crée aussi un risque de contamination des données d’entraînement ou d’évaluation. La rigueur comparative est en outre réduite par des scores majoritairement auto-déclarés par les éditeurs, plutôt que mesurés selon un protocole indépendant commun. Le classement place Gemma 2 27B en tête à 89 %, soit sept points au-dessus de la médiane. Il révèle une solide maîtrise de cette tâche ciblée, mais ne mesure que des QCM scientifiques scolaires en anglais et ne suffit pas à caractériser des capacités générales au-delà de ce cadre.


Sources des scores : llm-stats.