Global-MMLU

Global-MMLU est un benchmark multilingue conçu en 2024 par Cohere For AI (Cohere Labs), avec des collaborateurs de l’EPFL, Hugging Face, Mila et McGill. Il évalue les connaissances académiques et le raisonnement au moyen de questions à choix multiple traduites dans de nombreuses langues.

Global-MMLU est un benchmark multilingue conçu en 2024 par Cohere For AI (Cohere Labs), avec des collaborateurs de l’EPFL, Hugging Face, Mila et McGill. Il évalue les connaissances académiques et le raisonnement au moyen de questions à choix multiple traduites dans de nombreuses langues.

Son approche distingue des sous-ensembles culturellement sensibles et culturellement agnostiques afin de mieux prendre en compte les biais linguistiques et culturels. Global-MMLU sert ainsi à comparer les capacités académiques des modèles dans un cadre multilingue plus équilibré que celui d’une évaluation limitée à une seule langue.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkCohere For AI (Cohere Labs) et collaborateurs (EPFL, Hugging Face, Mila, McGill)
Capacités mesuréesConnaissances académiques multilingues et raisonnement, avec sous-ensembles culturellement sensibles vs agnostiques pour corriger les biais culturels/linguistiques
ModalitéTexte
Type de questionsQCM (questions à choix multiple)
Métrique d'évaluationexactitude (accuracy)
AccèsPublic
LicenceApache-2.0
Langues42 langues (multilingue)
Taille du jeu~14 000 questions par langue (~589 000 traductions au total)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (5)

#ModèleÉditeurLicenceScoreSortieFiabilité
1MiMo-V2.5-ProXiaomi🟢 Ouvert83,6 %27 avril 2026Auto-déclaré
2Gemma 3n E4B InstructedGoogle🔒 Propriétaire60,3 %26 juin 2025Auto-déclaré
3Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert60,3 %20 mai 2025Auto-déclaré
4Gemma 3n E2B InstructedGoogle🔒 Propriétaire55,1 %26 juin 2025Auto-déclaré
5Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert55,1 %20 mai 2025Auto-déclaré

Classement établi sur 5 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 60,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur Global-MMLU indique qu’un modèle sélectionne fréquemment la bonne réponse à des questions académiques multilingues, y compris dans les sous-ensembles destinés à mieux contrôler les effets culturels et linguistiques. Il reflète donc à la fois des connaissances et une aptitude au raisonnement dans le format QCM, sans résumer l’ensemble des capacités d’un système. Le classement de la base montre une dispersion marquée parmi les cinq modèles évalués : MiMo-V2.5-Pro atteint 84 %, tandis que la médiane s’établit à 60 %. Cet écart signale un avantage net du meilleur modèle sur cet ensemble précis. L’interprétation doit néanmoins rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. Le caractère public du benchmark appelle aussi à surveiller un éventuel effet de contamination lors des entraînements. Enfin, une progression des résultats vers des niveaux très élevés pourrait réduire son pouvoir discriminant par saturation. Sa portée reste celle de questions académiques à choix multiple, et non d’une évaluation générale de toutes les compétences d’un modèle.


Sources des scores : llm-stats.