Global-MMLU
Global-MMLU est un benchmark multilingue conçu en 2024 par Cohere For AI (Cohere Labs), avec des collaborateurs de l’EPFL, Hugging Face, Mila et McGill. Il évalue les connaissances académiques et le raisonnement au moyen de questions à choix multiple traduites dans de nombreuses langues.
Global-MMLU est un benchmark multilingue conçu en 2024 par Cohere For AI (Cohere Labs), avec des collaborateurs de l’EPFL, Hugging Face, Mila et McGill. Il évalue les connaissances académiques et le raisonnement au moyen de questions à choix multiple traduites dans de nombreuses langues.
Son approche distingue des sous-ensembles culturellement sensibles et culturellement agnostiques afin de mieux prendre en compte les biais linguistiques et culturels. Global-MMLU sert ainsi à comparer les capacités académiques des modèles dans un cadre multilingue plus équilibré que celui d’une évaluation limitée à une seule langue.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Cohere For AI (Cohere Labs) et collaborateurs (EPFL, Hugging Face, Mila, McGill) |
| Capacités mesurées | Connaissances académiques multilingues et raisonnement, avec sous-ensembles culturellement sensibles vs agnostiques pour corriger les biais culturels/linguistiques |
| Modalité | Texte |
| Type de questions | QCM (questions à choix multiple) |
| Métrique d'évaluation | exactitude (accuracy) |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | 42 langues (multilingue) |
| Taille du jeu | ~14 000 questions par langue (~589 000 traductions au total) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (5)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 83,6 % | 27 avril 2026 | Auto-déclaré |
| 2 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 60,3 % | 26 juin 2025 | Auto-déclaré | |
| 3 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 60,3 % | 20 mai 2025 | Auto-déclaré | |
| 4 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 55,1 % | 26 juin 2025 | Auto-déclaré | |
| 5 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 55,1 % | 20 mai 2025 | Auto-déclaré |
Classement établi sur 5 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 60,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur Global-MMLU indique qu’un modèle sélectionne fréquemment la bonne réponse à des questions académiques multilingues, y compris dans les sous-ensembles destinés à mieux contrôler les effets culturels et linguistiques. Il reflète donc à la fois des connaissances et une aptitude au raisonnement dans le format QCM, sans résumer l’ensemble des capacités d’un système. Le classement de la base montre une dispersion marquée parmi les cinq modèles évalués : MiMo-V2.5-Pro atteint 84 %, tandis que la médiane s’établit à 60 %. Cet écart signale un avantage net du meilleur modèle sur cet ensemble précis. L’interprétation doit néanmoins rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. Le caractère public du benchmark appelle aussi à surveiller un éventuel effet de contamination lors des entraînements. Enfin, une progression des résultats vers des niveaux très élevés pourrait réduire son pouvoir discriminant par saturation. Sa portée reste celle de questions académiques à choix multiple, et non d’une évaluation générale de toutes les compétences d’un modèle.
Sources des scores : llm-stats.