Global-MMLU-Lite

Global-MMLU-Lite est une version allégée de Global MMLU, créée en 2024 par Cohere Labs, également connu sous le nom Cohere For AI. Ce benchmark public évalue efficacement les connaissances et le raisonnement de modèles de langage dans un cadre multilingue.

Global-MMLU-Lite est une version allégée de Global MMLU, créée en 2024 par Cohere Labs, également connu sous le nom Cohere For AI. Ce benchmark public évalue efficacement les connaissances et le raisonnement de modèles de langage dans un cadre multilingue.

Ses questions à choix multiples distinguent les contenus culturellement sensibles des contenus culturellement agnostiques. Cette séparation vise à réduire les biais culturels et linguistiques, tout en facilitant la comparaison des capacités des modèles dans 23 langues au moyen d’un protocole commun.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkCohere Labs (Cohere For AI)
Capacités mesuréesÉvaluation multilingue efficace de la connaissance et du raisonnement, en distinguant questions culturellement sensibles et agnostiques pour réduire les biais.
ModalitéTexte
Type de questionsQuestions à choix multiples multilingues (culturellement sensibles / agnostiques)
Métrique d'évaluationExactitude (accuracy)
AccèsPublic
LicenceApache-2.0
Langues23 langues (multilingue)
Taille du jeu9200 échantillons de test (~13855 avec le dev) ; 200 CS + 200 CA par langue
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (14)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 2.5 Pro Preview 06-05Google🔒 Propriétaire89,2 %5 juin 2025Auto-déclaré
2Gemini 2.5 ProGoogle🔒 Propriétaire88,6 %20 mai 2025Auto-déclaré
3Gemini 2.5 FlashGoogle🔒 Propriétaire88,4 %20 mai 2025Auto-déclaré
4Gemini 2.5 Flash-LiteGoogle🟢 Ouvert81,1 %17 juin 2025Auto-déclaré
5Gemini 2.0 Flash-LiteGoogle🔒 Propriétaire78,2 %5 février 2025Auto-déclaré
6Gemma 3 27BGoogle🟢 Ouvert75,1 %12 mars 2025Auto-déclaré
7Gemma 3 12BGoogle🟢 Ouvert69,5 %12 mars 2025Auto-déclaré
8Gemini DiffusionGoogle🔒 Propriétaire69,1 %20 mai 2025Auto-déclaré
9Gemma 3n E4B InstructedGoogle🔒 Propriétaire64,5 %26 juin 2025Auto-déclaré
10Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert64,5 %20 mai 2025Auto-déclaré
11Gemma 3n E2B InstructedGoogle🔒 Propriétaire59,0 %26 juin 2025Auto-déclaré
12Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert59,0 %20 mai 2025Auto-déclaré
13Gemma 3 4BGoogle🟢 Ouvert54,5 %12 mars 2025Auto-déclaré
14Gemma 3 1BGoogle🟢 Ouvert34,2 %12 mars 2025Auto-déclaré

Classement établi sur 14 modèles évalués, dont 14 de grands éditeurs. Score médian de l'ensemble : 69,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique une forte exactitude sur les questions multilingues du benchmark, couvrant à la fois connaissances et raisonnement, avec une prise en compte explicite de la sensibilité culturelle. Dans la base, Gemini 2.5 Pro Preview 06-05 atteint 89 %, contre une médiane de 69 % parmi les 14 modèles évalués. Cet écart révèle une avance nette du meilleur modèle et une marge de progression encore visible, ce qui ne suggère pas une saturation complète du classement.

La lecture comparative exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre indépendant uniforme. Cette provenance peut affecter la rigueur de la comparaison. Le risque de contamination doit également être considéré lors de l’interprétation d’un benchmark public. Enfin, la portée des résultats reste celle de Global-MMLU-Lite : l’exactitude sur des questions à choix multiples, dans 23 langues et selon la distinction entre contenus culturellement sensibles et agnostiques. Le classement décrit donc cette compétence ciblée, et non l’ensemble des capacités possibles d’un modèle.


Sources des scores : llm-stats.