MAXIFE
MAXIFE est un benchmark multilingue créé en 2025 par Waseda University et OPPO AI Center. Il évalue la capacité des grands modèles de langage à suivre et exécuter des instructions dans plusieurs langues, y compris dans des situations cross-lingues et des contextes culturels variés.
MAXIFE est un benchmark multilingue créé en 2025 par Waseda University et OPPO AI Center. Il évalue la capacité des grands modèles de langage à suivre et exécuter des instructions dans plusieurs langues, y compris dans des situations cross-lingues et des contextes culturels variés.
Le protocole repose sur des questions de base associées à des instructions vérifiables et composables. MAXIFE sert ainsi à comparer la fidélité d’exécution des modèles, leur gestion simultanée de plusieurs contraintes et leur robustesse interculturelle, au-delà de la simple production d’une réponse linguistiquement plausible.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Waseda University & OPPO AI Center |
| Capacités mesurées | Suivi d'instructions multilingue et cross-lingue, robustesse interculturelle |
| Modalité | Texte |
| Type de questions | Suivi d'instructions vérifiables (questions de base + instructions composables) |
| Métrique d'évaluation | Précision (évaluation hybride : règles + modèle juge) |
| Accès | Public |
| Langues | multilingue |
| Taille du jeu | 795 questions de base et 1667 instructions (1-3 instructions par question) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (11)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 89,2 % | 19 mai 2026 | Auto-déclaré |
| 2 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 88,8 % | 31 mai 2026 | Auto-déclaré |
| 3 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,2 % | 16 février 2026 | Auto-déclaré |
| 4 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 88,2 % | 31 mars 2026 | Auto-déclaré |
| 5 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,0 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,9 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,6 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,4 % | 2 mars 2026 | Auto-déclaré |
| 9 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,0 % | 2 mars 2026 | Auto-déclaré |
| 10 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,6 % | 2 mars 2026 | Auto-déclaré |
| 11 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 39,2 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 11 modèles évalués. Score médian de l'ensemble : 87,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MAXIFE indique qu’un modèle respecte fréquemment les contraintes vérifiables qui accompagnent les questions, y compris lorsque plusieurs instructions doivent être combinées. Il mesure donc une précision d’exécution multilingue et cross-lingue, mais ne constitue pas une mesure générale de toutes les capacités d’un modèle. L’évaluation hybride, fondée sur des règles et un modèle juge, associe des contrôles explicites à une appréciation automatisée. La fiabilité comparative doit toutefois être nuancée, car les scores de la base sont majoritairement auto-déclarés par les éditeurs. Le classement est très resserré : Qwen3.7 Max arrive en tête, mais son résultat ne dépasse la médiane de l’ensemble que d’un point. Cette faible dispersion suggère une saturation au sommet et limite la portée pratique des écarts de classement. Le caractère public du benchmark invite également à considérer le risque de contamination lors de l’interprétation des performances. Enfin, MAXIFE renseigne spécifiquement sur le suivi d’instructions vérifiables dans plusieurs langues et contextes culturels, sans résumer à lui seul la qualité globale des modèles évalués.
Sources des scores : llm-stats.