Include
Include est un benchmark conçu par Angelika Romanou et ses coauteurs à l’EPFL et chez Cohere For AI. Il évalue la compréhension multilingue des modèles à partir de questions issues d’examens locaux, ancrées dans des connaissances régionales et culturelles.
Include est un benchmark conçu par Angelika Romanou et ses coauteurs à l’EPFL et chez Cohere For AI. Il évalue la compréhension multilingue des modèles à partir de questions issues d’examens locaux, ancrées dans des connaissances régionales et culturelles.
Son format en QCM permet de comparer la capacité des modèles à sélectionner une réponse correcte parmi plusieurs options dans des contextes linguistiques et géographiques variés. Include complète ainsi les évaluations généralistes en mettant l’accent sur des savoirs situés, au-delà des seuls contenus dominants à l’échelle internationale.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Angelika Romanou et al. (EPFL & Cohere For AI) |
| Capacités mesurées | Compréhension multilingue ancrée dans des connaissances régionales et culturelles, à partir d'examens locaux. |
| Modalité | Texte |
| Type de questions | QCM (4 options) |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | multilingue : 44 langues (15 écritures, 52 pays) |
| Taille du jeu | 197 243 questions (1 926 examens) ; sous-ensemble public d'évaluation : 22 637 QCM |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (31)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 87,6 % | 28 mai 2026 | Auto-déclaré |
| 2 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 86,2 % | 19 mai 2026 | Auto-déclaré |
| 3 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,6 % | 16 février 2026 | Auto-déclaré |
| 4 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 85,1 % | 31 mars 2026 | Auto-déclaré |
| 5 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 83,0 % | 31 mai 2026 | Auto-déclaré |
| 6 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,8 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,6 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,0 % | 25 juillet 2025 | Auto-déclaré |
| 9 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,0 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,0 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,7 % | 24 février 2026 | Auto-déclaré |
| 12 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,5 % | 22 juillet 2025 | Auto-déclaré |
| 13 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,9 % | 10 septembre 2025 | Auto-déclaré |
| 14 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,9 % | 10 septembre 2025 | Auto-déclaré |
| 15 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,3 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,6 % | 2 mars 2026 | Auto-déclaré |
| 17 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,5 % | 22 septembre 2025 | Auto-déclaré |
| 18 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,0 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,5 % | 29 avril 2025 | Auto-déclaré |
| 20 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,6 % | 22 septembre 2025 | Auto-déclaré |
| 21 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,0 % | 2 mars 2026 | Auto-déclaré |
| 22 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,5 % | 22 septembre 2025 | Auto-déclaré |
| 23 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,0 % | 22 septembre 2025 | Auto-déclaré |
| 24 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,6 % | 22 septembre 2025 | Auto-déclaré |
| 25 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,4 % | 22 septembre 2025 | Auto-déclaré |
| 26 | Gemma 3n E4B Instructed | 🔒 Propriétaire | 57,2 % | 26 juin 2025 | Auto-déclaré | |
| 27 | Gemma 3n E4B Instructed LiteRT Preview | 🟢 Ouvert | 57,2 % | 20 mai 2025 | Auto-déclaré | |
| 28 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 55,4 % | 2 mars 2026 | Auto-déclaré |
| 29 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 40,6 % | 2 mars 2026 | Auto-déclaré |
| 30 | Gemma 3n E2B Instructed | 🔒 Propriétaire | 38,6 % | 26 juin 2025 | Auto-déclaré | |
| 31 | Gemma 3n E2B Instructed LiteRT (Preview) | 🟢 Ouvert | 38,6 % | 20 mai 2025 | Auto-déclaré |
Classement établi sur 31 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 75,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur Include indique qu’un modèle répond correctement à une grande part des QCM couvrant diverses langues, écritures et réalités nationales. Il reflète donc une bonne compréhension multilingue associée à des connaissances régionales et culturelles, dans le cadre précis d’examens locaux. L’accuracy fournit une mesure simple et comparable, mais la fiabilité du classement doit être nuancée puisque les scores sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés selon un protocole indépendant commun.
La médiane de 76 % et le meilleur résultat, 88 % pour Claude Opus 4.8, montrent un avantage net du modèle de tête sans saturation complète du benchmark. Le classement de 31 modèles révèle ainsi des écarts encore visibles sur cette tâche. Sa portée reste toutefois circonscrite aux QCM et aux connaissances mobilisées par les examens retenus, sans représenter toutes les formes de raisonnement ou de production multilingue. Enfin, l’accès public au sous-ensemble d’évaluation impose de considérer le risque de contamination lors de l’interprétation des performances futures.
Sources des scores : llm-stats.