Multi-IF
Multi-IF est un benchmark créé en 2024 par Meta GenAI pour évaluer la capacité des grands modèles de langage à suivre des instructions dans des dialogues multilingues à plusieurs tours. Il prolonge IFEval en ajoutant des séquences conversationnelles et des traductions de prompts anglais.
Multi-IF est un benchmark créé en 2024 par Meta GenAI pour évaluer la capacité des grands modèles de langage à suivre des instructions dans des dialogues multilingues à plusieurs tours. Il prolonge IFEval en ajoutant des séquences conversationnelles et des traductions de prompts anglais.
Son évaluation vérifiable porte sur le respect des consignes à chaque tour, notamment lorsque celles-ci imposent une sortie structurée. Multi-IF sert ainsi à mesurer la stabilité du suivi d’instructions au fil d’un échange et entre plusieurs langues.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Meta (GenAI) |
| Capacités mesurées | suivi d'instructions, multilingue, gestion de dialogues multi-tours, sortie structurée |
| Modalité | Texte |
| Type de questions | suivi d'instructions vérifiable sur 3 tours de dialogue, en 8 langues |
| Métrique d'évaluation | exactitude de suivi d'instruction (instruction accuracy), par tour |
| Accès | Public |
| Langues | 8 langues (anglais + 7 traductions, dont chinois, hindi, russe) |
| Taille du jeu | 4501 conversations multilingues, 3 tours chacune, 8 langues |
| Année de publication | 2024 |
| Ressources | Article scientifique |
Classement des modèles (20)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,6 % | 25 juillet 2025 | Auto-déclaré |
| 2 | o3-mini | OpenAI | 🔒 Propriétaire | 79,5 % | 30 janvier 2025 | Auto-déclaré |
| 3 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,1 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,0 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,8 % | 10 septembre 2025 | Auto-déclaré |
| 6 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,5 % | 22 juillet 2025 | Auto-déclaré |
| 7 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,3 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,8 % | 10 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,1 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 75,1 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,6 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,0 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 30B A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,2 % | 29 avril 2025 | Auto-déclaré |
| 14 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,0 % | 22 septembre 2025 | Auto-déclaré |
| 15 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 70,8 % | 14 avril 2025 | Auto-déclaré |
| 16 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 70,8 % | 5 mars 2026 | Auto-déclaré |
| 17 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 67,0 % | 14 avril 2025 | Auto-déclaré |
| 18 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,1 % | 22 septembre 2025 | Auto-déclaré |
| 19 | GPT-4o | OpenAI | 🔒 Propriétaire | 60,9 % | 27 mars 2025 | Auto-déclaré |
| 20 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 57,2 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 20 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 74,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle respecte avec exactitude les instructions vérifiables à chacun des trois tours, y compris dans un contexte multilingue et avec des contraintes de format. Cette mesure par tour permet de faire apparaître les pertes de précision à mesure que le dialogue avance. La comparaison doit néanmoins rester prudente, car les scores de la base sont majoritairement auto-déclarés par les éditeurs, plutôt qu’issus d’une procédure indépendante homogène.
Le meilleur résultat, 81 % pour Qwen3-235B-A22B-Thinking-2507, reste relativement proche de la médiane de 74 % observée parmi les 20 modèles évalués. Le classement ne suggère donc pas une saturation complète du benchmark et confirme une marge de progression dans le maintien des consignes. Sa portée reste centrée sur des instructions vérifiables, trois tours et huit langues issues d’un ensemble anglais traduit. Les résultats publiés montrent en outre des taux d’erreur plus élevés pour les langues utilisant des écritures non latines. L’accès public au jeu favorise la reproductibilité des évaluations, tout en imposant de considérer avec attention son exposition lors de futures comparaisons.
Sources des scores : llm-stats.