Global-MMLU-Lite
Global-MMLU-Lite est une version allégée de Global MMLU, créée en 2024 par Cohere Labs, également connu sous le nom Cohere For AI. Ce benchmark public évalue efficacement les connaissances et le raisonnement de modèles de langage dans un cadre multilingue.
Global-MMLU-Lite est une version allégée de Global MMLU, créée en 2024 par Cohere Labs, également connu sous le nom Cohere For AI. Ce benchmark public évalue efficacement les connaissances et le raisonnement de modèles de langage dans un cadre multilingue.
Ses questions à choix multiples distinguent les contenus culturellement sensibles des contenus culturellement agnostiques. Cette séparation vise à réduire les biais culturels et linguistiques, tout en facilitant la comparaison des capacités des modèles dans 23 langues au moyen d’un protocole commun.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Cohere Labs (Cohere For AI) |
| Capacités mesurées | Évaluation multilingue efficace de la connaissance et du raisonnement, en distinguant questions culturellement sensibles et agnostiques pour réduire les biais. |
| Modalité | Texte |
| Type de questions | Questions à choix multiples multilingues (culturellement sensibles / agnostiques) |
| Métrique d'évaluation | Exactitude (accuracy) |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | 23 langues (multilingue) |
| Taille du jeu | 9200 échantillons de test (~13855 avec le dev) ; 200 CS + 200 CA par langue |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (14)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 2.5 Pro Preview 06-05 | 🔒 Propriétaire | 89,2 % | 5 juin 2025 | Auto-déclaré | |
| 2 | Gemini 2.5 Pro | 🔒 Propriétaire | 88,6 % | 20 mai 2025 | Auto-déclaré | |
| 3 | Gemini 2.5 Flash | 🔒 Propriétaire | 88,4 % | 20 mai 2025 | Auto-déclaré | |
| 4 | Gemini 2.5 Flash-Lite | 🟢 Ouvert | 81,1 % | 17 juin 2025 | Auto-déclaré | |
| 5 | Gemini 2.0 Flash-Lite | 🔒 Propriétaire | 78,2 % | 5 février 2025 | Auto-déclaré | |
| 6 | Gemma 3 27B | 🟢 Ouvert | 75,1 % | 12 mars 2025 | Auto-déclaré | |
| 7 | Gemma 3 12B | 🟢 Ouvert | 69,5 % | 12 mars 2025 | Auto-déclaré | |
| 8 | Gemini Diffusion | 🔒 Propriétaire | 69,1 % | 20 mai 2025 | Auto-déclaré | |
| 9 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 64,5 % | 26 juin 2025 | Auto-déclaré | |
| 10 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 64,5 % | 20 mai 2025 | Auto-déclaré | |
| 11 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 59,0 % | 26 juin 2025 | Auto-déclaré | |
| 12 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 59,0 % | 20 mai 2025 | Auto-déclaré | |
| 13 | Gemma 3 4B | 🟢 Ouvert | 54,5 % | 12 mars 2025 | Auto-déclaré | |
| 14 | Gemma 3 1B | 🟢 Ouvert | 34,2 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 14 modèles évalués, dont 14 de grands éditeurs. Score médian de l'ensemble : 69,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique une forte exactitude sur les questions multilingues du benchmark, couvrant à la fois connaissances et raisonnement, avec une prise en compte explicite de la sensibilité culturelle. Dans la base, Gemini 2.5 Pro Preview 06-05 atteint 89 %, contre une médiane de 69 % parmi les 14 modèles évalués. Cet écart révèle une avance nette du meilleur modèle et une marge de progression encore visible, ce qui ne suggère pas une saturation complète du classement.
La lecture comparative exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre indépendant uniforme. Cette provenance peut affecter la rigueur de la comparaison. Le risque de contamination doit également être considéré lors de l’interprétation d’un benchmark public. Enfin, la portée des résultats reste celle de Global-MMLU-Lite : l’exactitude sur des questions à choix multiples, dans 23 langues et selon la distinction entre contenus culturellement sensibles et agnostiques. Le classement décrit donc cette compétence ciblée, et non l’ensemble des capacités possibles d’un modèle.
Sources des scores : llm-stats.