ARC-E
ARC-E est le sous-ensemble facile du AI2 Reasoning Challenge, créé par l’Allen Institute for Artificial Intelligence (AI2) et Peter Clark et al. Il rassemble des QCM scientifiques en anglais de niveau scolaire, conçus pour mobiliser des connaissances et des capacités de raisonnement.
ARC-E est le sous-ensemble facile du AI2 Reasoning Challenge, créé par l’Allen Institute for Artificial Intelligence (AI2) et Peter Clark et al. Il rassemble des QCM scientifiques en anglais de niveau scolaire, conçus pour mobiliser des connaissances et des capacités de raisonnement.
Le benchmark évalue notamment le rappel de faits, la compréhension des questions et le raisonnement élémentaire. Ses questions pouvant être résolues par des méthodes de recherche d’information et de cooccurrence de mots, il constitue un test accessible des compétences scientifiques générales des modèles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Allen Institute for Artificial Intelligence (AI2), Peter Clark et al. |
| Capacités mesurées | généraliste, raisonnement |
| Modalité | Texte |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Licence | CC BY-SA 4.0 |
| Langues | anglais |
| Taille du jeu | 5 197 questions |
| Année de publication | 2018 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (8)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemma 2 27B | 🟢 Ouvert | 88,6 % | 27 juin 2024 | Auto-déclaré | |
| 2 | Gemma 2 9B | 🟢 Ouvert | 88,0 % | 27 juin 2024 | Auto-déclaré | |
| 3 | Hermes 3 70B | Nous Research | 🟢 Ouvert | 83,0 % | 15 août 2024 | Auto-déclaré |
| 4 | Gemma 3n E4B | 🔒 Propriétaire | 81,6 % | 26 juin 2025 | Auto-déclaré | |
| 5 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 81,6 % | 20 mai 2025 | Auto-déclaré | |
| 6 | Gemma 3n E2B | 🔒 Propriétaire | 75,8 % | 26 juin 2025 | Auto-déclaré | |
| 7 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 75,8 % | 20 mai 2025 | Auto-déclaré | |
| 8 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 60,7 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 8 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 81,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur ARC-E indique qu’un modèle répond correctement à une forte proportion de QCM scientifiques scolaires, en combinant rappel factuel, compréhension et raisonnement élémentaire. Cette performance doit toutefois être interprétée dans le périmètre du sous-ensemble facile, dont les questions sont accessibles à des algorithmes fondés sur la recherche d’information ou les cooccurrences lexicales. Une médiane de 82 % parmi les huit modèles évalués suggère un benchmark déjà relativement saturé dans cette sélection, ce qui peut limiter sa capacité à départager finement les systèmes les plus performants. Le caractère public du jeu crée aussi un risque de contamination des données d’entraînement ou d’évaluation. La rigueur comparative est en outre réduite par des scores majoritairement auto-déclarés par les éditeurs, plutôt que mesurés selon un protocole indépendant commun. Le classement place Gemma 2 27B en tête à 89 %, soit sept points au-dessus de la médiane. Il révèle une solide maîtrise de cette tâche ciblée, mais ne mesure que des QCM scientifiques scolaires en anglais et ne suffit pas à caractériser des capacités générales au-delà de ce cadre.
Sources des scores : llm-stats.