Multi-Challenge
Multi-Challenge est un benchmark créé en 2025 par l’équipe SEAL de Scale AI, au sein de Scale Labs. Il évalue les modèles dans des conversations réalistes et contextuellement complexes, portant notamment sur la planification de voyages, la documentation technique et la communication…
Multi-Challenge est un benchmark créé en 2025 par l’équipe SEAL de Scale AI, au sein de Scale Labs. Il évalue les modèles dans des conversations réalistes et contextuellement complexes, portant notamment sur la planification de voyages, la documentation technique et la communication professionnelle.
Son objectif est de mesurer la capacité à maintenir des instructions, mémoriser et relier des informations antérieures, appliquer des modifications successives de manière fiable et éviter les contradictions. Il teste ainsi la continuité du raisonnement et du comportement au fil d’un dialogue.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Scale AI (equipe SEAL / Scale Labs) |
| Capacités mesurées | Conversations multi-tours realistes : retention d'instructions, memoire d'inference des informations utilisateur, edition versionnee fiable, auto-coherence |
| Modalité | Texte |
| Type de questions | conversations multi-tours (max 10 tours) avec reponse au dernier tour utilisateur, jugees par un LLM |
| Métrique d'évaluation | exactitude jugee par LLM (accuracy) |
| Langues | anglais |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (28)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Nova 2 Pro | Amazon | 🔒 Propriétaire | 77,7 % | 2 décembre 2025 | Auto-déclaré |
| 2 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 76,6 % | 2 décembre 2025 | Auto-déclaré |
| 3 | Nova 2 Omni | Amazon | 🔒 Propriétaire | 75,5 % | 2 décembre 2025 | Auto-déclaré |
| 4 | GPT-5 | OpenAI | 🔒 Propriétaire | 69,6 % | 7 août 2025 | Auto-déclaré |
| 5 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,6 % | 16 février 2026 | Auto-déclaré |
| 6 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 63,8 % | 4 juin 2026 | Auto-déclaré |
| 7 | Step3-VL-10B | StepFun | 🟢 Ouvert | 62,6 % | 15 janvier 2026 | Auto-déclaré |
| 8 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,5 % | 24 février 2026 | Auto-déclaré |
| 9 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,8 % | 24 février 2026 | Auto-déclaré |
| 10 | o3 | OpenAI | 🔒 Propriétaire | 60,4 % | 16 avril 2025 | Auto-déclaré |
| 11 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,0 % | 24 février 2026 | Auto-déclaré |
| 12 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 55,2 % | 11 mars 2026 | Auto-déclaré |
| 13 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 54,5 % | 2 mars 2026 | Auto-déclaré |
| 14 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 54,1 % | 11 juillet 2025 | Auto-déclaré |
| 15 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 54,1 % | 5 septembre 2025 | Auto-déclaré |
| 16 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 53,0 % | 2 juin 2026 | Auto-déclaré |
| 17 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 49,0 % | 2 mars 2026 | Auto-déclaré |
| 18 | MiniMax M1 | MiniMax | 🟢 Ouvert | 44,7 % | 17 juin 2025 | Auto-déclaré |
| 19 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 43,8 % | 5 mars 2026 | Auto-déclaré |
| 20 | o4-mini | OpenAI | 🔒 Propriétaire | 43,0 % | 16 avril 2025 | Auto-déclaré |
| 21 | GPT-4o | OpenAI | 🔒 Propriétaire | 40,3 % | 27 mars 2025 | Auto-déclaré |
| 22 | o3-mini | OpenAI | 🔒 Propriétaire | 39,9 % | 30 janvier 2025 | Auto-déclaré |
| 23 | Nemotron 3 Nano (30B A3B) | NVIDIA | 🟢 Ouvert | 38,5 % | 15 décembre 2025 | Auto-déclaré |
| 24 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 38,3 % | 14 avril 2025 | Auto-déclaré |
| 25 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 35,8 % | 14 avril 2025 | Auto-déclaré |
| 26 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 33,7 % | 2 mars 2026 | Auto-déclaré |
| 27 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 18,9 % | 2 mars 2026 | Auto-déclaré |
| 28 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 15,0 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 28 modèles évalués, dont 16 de grands éditeurs. Score médian de l'ensemble : 54,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle répond correctement au dernier message après plusieurs échanges, tout en conservant les consignes, les informations implicites et les versions successives du contenu. L’évaluation repose sur un LLM juge et produit une mesure d’exactitude. La comparaison doit toutefois rester prudente, car les scores de la base sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés dans un cadre unique par un tiers.
Avec une médiane de 54 % sur 28 modèles et un meilleur résultat de 78 % pour Nova 2 Pro d’Amazon, le classement fait apparaître des écarts substantiels et une marge de progression. Il ne semble donc pas saturé au sommet des résultats recensés. Sa portée reste ciblée sur des conversations en anglais limitées à dix tours et sur quatre dimensions de continuité conversationnelle. Comme pour tout benchmark publié, une éventuelle contamination des données d’évaluation pourrait réduire la valeur comparative des scores. Multi-Challenge renseigne donc spécifiquement sur la robustesse multi-tours, sans résumer à lui seul l’ensemble des capacités d’un modèle.
Sources des scores : llm-stats.