Include

Include est un benchmark conçu par Angelika Romanou et ses coauteurs à l’EPFL et chez Cohere For AI. Il évalue la compréhension multilingue des modèles à partir de questions issues d’examens locaux, ancrées dans des connaissances régionales et culturelles.

Include est un benchmark conçu par Angelika Romanou et ses coauteurs à l’EPFL et chez Cohere For AI. Il évalue la compréhension multilingue des modèles à partir de questions issues d’examens locaux, ancrées dans des connaissances régionales et culturelles.

Son format en QCM permet de comparer la capacité des modèles à sélectionner une réponse correcte parmi plusieurs options dans des contextes linguistiques et géographiques variés. Include complète ainsi les évaluations généralistes en mettant l’accent sur des savoirs situés, au-delà des seuls contenus dominants à l’échelle internationale.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAngelika Romanou et al. (EPFL & Cohere For AI)
Capacités mesuréesCompréhension multilingue ancrée dans des connaissances régionales et culturelles, à partir d'examens locaux.
ModalitéTexte
Type de questionsQCM (4 options)
Métrique d'évaluationaccuracy
AccèsPublic
LicenceApache-2.0
Languesmultilingue : 44 langues (15 écritures, 52 pays)
Taille du jeu197 243 questions (1 926 examens) ; sous-ensemble public d'évaluation : 22 637 QCM
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (31)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Opus 4.8Anthropic🔒 Propriétaire87,6 %28 mai 2026Auto-déclaré
2Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire86,2 %19 mai 2026Auto-déclaré
3Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert85,6 %16 février 2026Auto-déclaré
4Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire85,1 %31 mars 2026Auto-déclaré
5Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire83,0 %31 mai 2026Auto-déclaré
6Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert82,8 %24 février 2026Auto-déclaré
7Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert81,6 %24 février 2026Auto-déclaré
8Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert81,0 %25 juillet 2025Auto-déclaré
9Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert80,0 %22 septembre 2025Auto-déclaré
10Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert80,0 %22 septembre 2025Auto-déclaré
11Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert79,7 %24 février 2026Auto-déclaré
12Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert79,5 %22 juillet 2025Auto-déclaré
13Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert78,9 %10 septembre 2025Auto-déclaré
14Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert78,9 %10 septembre 2025Auto-déclaré
15Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert76,3 %22 septembre 2025Auto-déclaré
16Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert75,6 %2 mars 2026Auto-déclaré
17Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert74,5 %22 septembre 2025Auto-déclaré
18Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert74,0 %22 septembre 2025Auto-déclaré
19Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert73,5 %29 avril 2025Auto-déclaré
20Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert71,6 %22 septembre 2025Auto-déclaré
21Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert71,0 %2 mars 2026Auto-déclaré
22Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert69,5 %22 septembre 2025Auto-déclaré
23Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert67,0 %22 septembre 2025Auto-déclaré
24Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert64,6 %22 septembre 2025Auto-déclaré
25Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert61,4 %22 septembre 2025Auto-déclaré
26Gemma 3n E4B InstructedGoogle🔒 Propriétaire57,2 %26 juin 2025Auto-déclaré
27Gemma 3n E4B Instructed LiteRT PreviewGoogle🟢 Ouvert57,2 %20 mai 2025Auto-déclaré
28Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert55,4 %2 mars 2026Auto-déclaré
29Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert40,6 %2 mars 2026Auto-déclaré
30Gemma 3n E2B InstructedGoogle🔒 Propriétaire38,6 %26 juin 2025Auto-déclaré
31Gemma 3n E2B Instructed LiteRT (Preview)Google🟢 Ouvert38,6 %20 mai 2025Auto-déclaré

Classement établi sur 31 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 75,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur Include indique qu’un modèle répond correctement à une grande part des QCM couvrant diverses langues, écritures et réalités nationales. Il reflète donc une bonne compréhension multilingue associée à des connaissances régionales et culturelles, dans le cadre précis d’examens locaux. L’accuracy fournit une mesure simple et comparable, mais la fiabilité du classement doit être nuancée puisque les scores sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés selon un protocole indépendant commun.

La médiane de 76 % et le meilleur résultat, 88 % pour Claude Opus 4.8, montrent un avantage net du modèle de tête sans saturation complète du benchmark. Le classement de 31 modèles révèle ainsi des écarts encore visibles sur cette tâche. Sa portée reste toutefois circonscrite aux QCM et aux connaissances mobilisées par les examens retenus, sans représenter toutes les formes de raisonnement ou de production multilingue. Enfin, l’accès public au sous-ensemble d’évaluation impose de considérer le risque de contamination lors de l’interprétation des performances futures.


Sources des scores : llm-stats.