AGIEval

AGIEval est un benchmark conçu en 2023 par Microsoft Research et Wanjun Zhong et al. Son approche centrée sur l’humain s’appuie sur des examens standardisés issus de contextes académiques et professionnels réels, notamment des concours d’entrée, des tests de droit, des compétitions…

AGIEval est un benchmark conçu en 2023 par Microsoft Research et Wanjun Zhong et al. Son approche centrée sur l’humain s’appuie sur des examens standardisés issus de contextes académiques et professionnels réels, notamment des concours d’entrée, des tests de droit, des compétitions mathématiques et des examens administratifs.

À travers des QCM et des tâches de cloze en anglais et en chinois, AGIEval évalue la compréhension, les connaissances, le raisonnement logique et mathématique, ainsi que les capacités de calcul. Il sert à comparer les modèles de fondation face à des problèmes structurés selon des exigences humaines.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMicrosoft Research / Wanjun Zhong et al.
Capacités mesuréesgénéraliste, juridique, mathématiques, raisonnement
ModalitéTexte
Type de questionsQCM et tâches de cloze
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais et chinois
Taille du jeuenviron 8 062 questions
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (10)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Mistral Small 3 24B BaseMistral AI🟢 Ouvert65,8 %30 janvier 2025Auto-déclaré
2Ministral 3 (14B Base 2512)Mistral AI🟢 Ouvert64,8 %4 décembre 2025Auto-déclaré
3Ministral 3 (8B Base 2512)Mistral AI🟢 Ouvert59,1 %4 décembre 2025Auto-déclaré
4Hermes 3 70BNous Research🟢 Ouvert56,2 %15 août 2024Auto-déclaré
5Gemma 2 27BGoogle🟢 Ouvert55,1 %27 juin 2024Auto-déclaré
6Gemma 2 9BGoogle🟢 Ouvert52,8 %27 juin 2024Auto-déclaré
7Ministral 3 (3B Base 2512)Mistral AI🟢 Ouvert51,1 %4 décembre 2025Auto-déclaré
8Granite 3.3 8B BaseIBM🟢 Ouvert49,3 %16 avril 2025Auto-déclaré
9Ministral 8B InstructMistral AI🟢 Ouvert48,3 %16 octobre 2024Auto-déclaré
10ERNIE 4.5Baidu🔒 Propriétaire28,5 %25 juin 2025Auto-déclaré

Classement établi sur 10 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 54,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur AGIEval indique qu’un modèle fournit fréquemment la réponse attendue à des questions d’examens standardisés. Il reflète donc une combinaison de compréhension, de restitution de connaissances, de raisonnement et de calcul. L’accuracy offre une mesure directe, mais elle réduit chaque réponse à un résultat correct ou incorrect et ne décrit pas la qualité du cheminement suivi.

Dans la base considérée, la médiane de 54 % et le meilleur score de 66 %, obtenu par Mistral Small 3 24B Base, montrent un écart réel entre les modèles évalués et n’indiquent pas une saturation complète du benchmark. La portée reste toutefois liée aux formats QCM et cloze, ainsi qu’aux domaines couverts par les examens académiques et professionnels en anglais et en chinois. Son accès public crée aussi un risque de contamination des données d’entraînement, susceptible d’influencer les résultats. Enfin, la majorité des scores étant auto-déclarés par les éditeurs, leur comparabilité est moins rigoureuse que celle de mesures produites dans un protocole indépendant et uniformément contrôlé.


Sources des scores : llm-stats.