AGIEval
AGIEval est un benchmark conçu en 2023 par Microsoft Research et Wanjun Zhong et al. Son approche centrée sur l’humain s’appuie sur des examens standardisés issus de contextes académiques et professionnels réels, notamment des concours d’entrée, des tests de droit, des compétitions…
AGIEval est un benchmark conçu en 2023 par Microsoft Research et Wanjun Zhong et al. Son approche centrée sur l’humain s’appuie sur des examens standardisés issus de contextes académiques et professionnels réels, notamment des concours d’entrée, des tests de droit, des compétitions mathématiques et des examens administratifs.
À travers des QCM et des tâches de cloze en anglais et en chinois, AGIEval évalue la compréhension, les connaissances, le raisonnement logique et mathématique, ainsi que les capacités de calcul. Il sert à comparer les modèles de fondation face à des problèmes structurés selon des exigences humaines.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Microsoft Research / Wanjun Zhong et al. |
| Capacités mesurées | généraliste, juridique, mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | QCM et tâches de cloze |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais et chinois |
| Taille du jeu | environ 8 062 questions |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (10)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Mistral Small 3 24B Base | Mistral AI | 🟢 Ouvert | 65,8 % | 30 janvier 2025 | Auto-déclaré |
| 2 | Ministral 3 (14B Base 2512) | Mistral AI | 🟢 Ouvert | 64,8 % | 4 décembre 2025 | Auto-déclaré |
| 3 | Ministral 3 (8B Base 2512) | Mistral AI | 🟢 Ouvert | 59,1 % | 4 décembre 2025 | Auto-déclaré |
| 4 | Hermes 3 70B | Nous Research | 🟢 Ouvert | 56,2 % | 15 août 2024 | Auto-déclaré |
| 5 | Gemma 2 27B | 🟢 Ouvert | 55,1 % | 27 juin 2024 | Auto-déclaré | |
| 6 | Gemma 2 9B | 🟢 Ouvert | 52,8 % | 27 juin 2024 | Auto-déclaré | |
| 7 | Ministral 3 (3B Base 2512) | Mistral AI | 🟢 Ouvert | 51,1 % | 4 décembre 2025 | Auto-déclaré |
| 8 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 49,3 % | 16 avril 2025 | Auto-déclaré |
| 9 | Ministral 8B Instruct | Mistral AI | 🟢 Ouvert | 48,3 % | 16 octobre 2024 | Auto-déclaré |
| 10 | ERNIE 4.5 | Baidu | 🔒 Propriétaire | 28,5 % | 25 juin 2025 | Auto-déclaré |
Classement établi sur 10 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 54,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur AGIEval indique qu’un modèle fournit fréquemment la réponse attendue à des questions d’examens standardisés. Il reflète donc une combinaison de compréhension, de restitution de connaissances, de raisonnement et de calcul. L’accuracy offre une mesure directe, mais elle réduit chaque réponse à un résultat correct ou incorrect et ne décrit pas la qualité du cheminement suivi.
Dans la base considérée, la médiane de 54 % et le meilleur score de 66 %, obtenu par Mistral Small 3 24B Base, montrent un écart réel entre les modèles évalués et n’indiquent pas une saturation complète du benchmark. La portée reste toutefois liée aux formats QCM et cloze, ainsi qu’aux domaines couverts par les examens académiques et professionnels en anglais et en chinois. Son accès public crée aussi un risque de contamination des données d’entraînement, susceptible d’influencer les résultats. Enfin, la majorité des scores étant auto-déclarés par les éditeurs, leur comparabilité est moins rigoureuse que celle de mesures produites dans un protocole indépendant et uniformément contrôlé.
Sources des scores : llm-stats.