MAXIFE

MAXIFE est un benchmark multilingue créé en 2025 par Waseda University et OPPO AI Center. Il évalue la capacité des grands modèles de langage à suivre et exécuter des instructions dans plusieurs langues, y compris dans des situations cross-lingues et des contextes culturels variés.

MAXIFE est un benchmark multilingue créé en 2025 par Waseda University et OPPO AI Center. Il évalue la capacité des grands modèles de langage à suivre et exécuter des instructions dans plusieurs langues, y compris dans des situations cross-lingues et des contextes culturels variés.

Le protocole repose sur des questions de base associées à des instructions vérifiables et composables. MAXIFE sert ainsi à comparer la fidélité d’exécution des modèles, leur gestion simultanée de plusieurs contraintes et leur robustesse interculturelle, au-delà de la simple production d’une réponse linguistiquement plausible.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkWaseda University & OPPO AI Center
Capacités mesuréesSuivi d'instructions multilingue et cross-lingue, robustesse interculturelle
ModalitéTexte
Type de questionsSuivi d'instructions vérifiables (questions de base + instructions composables)
Métrique d'évaluationPrécision (évaluation hybride : règles + modèle juge)
AccèsPublic
Languesmultilingue
Taille du jeu795 questions de base et 1667 instructions (1-3 instructions par question)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (11)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire89,2 %19 mai 2026Auto-déclaré
2Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire88,8 %31 mai 2026Auto-déclaré
3Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert88,2 %16 février 2026Auto-déclaré
4Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire88,2 %31 mars 2026Auto-déclaré
5Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert88,0 %24 février 2026Auto-déclaré
6Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert87,9 %24 février 2026Auto-déclaré
7Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert86,6 %24 février 2026Auto-déclaré
8Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert83,4 %2 mars 2026Auto-déclaré
9Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert78,0 %2 mars 2026Auto-déclaré
10Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert60,6 %2 mars 2026Auto-déclaré
11Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert39,2 %2 mars 2026Auto-déclaré

Classement établi sur 11 modèles évalués. Score médian de l'ensemble : 87,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MAXIFE indique qu’un modèle respecte fréquemment les contraintes vérifiables qui accompagnent les questions, y compris lorsque plusieurs instructions doivent être combinées. Il mesure donc une précision d’exécution multilingue et cross-lingue, mais ne constitue pas une mesure générale de toutes les capacités d’un modèle. L’évaluation hybride, fondée sur des règles et un modèle juge, associe des contrôles explicites à une appréciation automatisée. La fiabilité comparative doit toutefois être nuancée, car les scores de la base sont majoritairement auto-déclarés par les éditeurs. Le classement est très resserré : Qwen3.7 Max arrive en tête, mais son résultat ne dépasse la médiane de l’ensemble que d’un point. Cette faible dispersion suggère une saturation au sommet et limite la portée pratique des écarts de classement. Le caractère public du benchmark invite également à considérer le risque de contamination lors de l’interprétation des performances. Enfin, MAXIFE renseigne spécifiquement sur le suivi d’instructions vérifiables dans plusieurs langues et contextes culturels, sans résumer à lui seul la qualité globale des modèles évalués.


Sources des scores : llm-stats.