Multi-Challenge

Multi-Challenge est un benchmark créé en 2025 par l’équipe SEAL de Scale AI, au sein de Scale Labs. Il évalue les modèles dans des conversations réalistes et contextuellement complexes, portant notamment sur la planification de voyages, la documentation technique et la communication…

Multi-Challenge est un benchmark créé en 2025 par l’équipe SEAL de Scale AI, au sein de Scale Labs. Il évalue les modèles dans des conversations réalistes et contextuellement complexes, portant notamment sur la planification de voyages, la documentation technique et la communication professionnelle.

Son objectif est de mesurer la capacité à maintenir des instructions, mémoriser et relier des informations antérieures, appliquer des modifications successives de manière fiable et éviter les contradictions. Il teste ainsi la continuité du raisonnement et du comportement au fil d’un dialogue.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkScale AI (equipe SEAL / Scale Labs)
Capacités mesuréesConversations multi-tours realistes : retention d'instructions, memoire d'inference des informations utilisateur, edition versionnee fiable, auto-coherence
ModalitéTexte
Type de questionsconversations multi-tours (max 10 tours) avec reponse au dernier tour utilisateur, jugees par un LLM
Métrique d'évaluationexactitude jugee par LLM (accuracy)
Languesanglais
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (28)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Nova 2 ProAmazon🔒 Propriétaire77,7 %2 décembre 2025Auto-déclaré
2Nova 2 LiteAmazon🔒 Propriétaire76,6 %2 décembre 2025Auto-déclaré
3Nova 2 OmniAmazon🔒 Propriétaire75,5 %2 décembre 2025Auto-déclaré
4GPT-5OpenAI🔒 Propriétaire69,6 %7 août 2025Auto-déclaré
5Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert67,6 %16 février 2026Auto-déclaré
6Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert63,8 %4 juin 2026Auto-déclaré
7Step3-VL-10BStepFun🟢 Ouvert62,6 %15 janvier 2026Auto-déclaré
8Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert61,5 %24 février 2026Auto-déclaré
9Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert60,8 %24 février 2026Auto-déclaré
10o3OpenAI🔒 Propriétaire60,4 %16 avril 2025Auto-déclaré
11Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert60,0 %24 février 2026Auto-déclaré
12Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert55,2 %11 mars 2026Auto-déclaré
13Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert54,5 %2 mars 2026Auto-déclaré
14Kimi K2 InstructMoonshot AI🟢 Ouvert54,1 %11 juillet 2025Auto-déclaré
15Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert54,1 %5 septembre 2025Auto-déclaré
16MAI-Thinking-1Microsoft🔒 Propriétaire53,0 %2 juin 2026Auto-déclaré
17Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert49,0 %2 mars 2026Auto-déclaré
18MiniMax M1MiniMax🟢 Ouvert44,7 %17 juin 2025Auto-déclaré
19GPT-4.5OpenAI🔒 Propriétaire43,8 %5 mars 2026Auto-déclaré
20o4-miniOpenAI🔒 Propriétaire43,0 %16 avril 2025Auto-déclaré
21GPT-4oOpenAI🔒 Propriétaire40,3 %27 mars 2025Auto-déclaré
22o3-miniOpenAI🔒 Propriétaire39,9 %30 janvier 2025Auto-déclaré
23Nemotron 3 Nano (30B A3B)NVIDIA🟢 Ouvert38,5 %15 décembre 2025Auto-déclaré
24GPT-4.1OpenAI🔒 Propriétaire38,3 %14 avril 2025Auto-déclaré
25GPT-4.1 miniOpenAI🔒 Propriétaire35,8 %14 avril 2025Auto-déclaré
26Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert33,7 %2 mars 2026Auto-déclaré
27Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert18,9 %2 mars 2026Auto-déclaré
28GPT-4.1 nanoOpenAI🔒 Propriétaire15,0 %14 avril 2025Auto-déclaré

Classement établi sur 28 modèles évalués, dont 16 de grands éditeurs. Score médian de l'ensemble : 54,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle répond correctement au dernier message après plusieurs échanges, tout en conservant les consignes, les informations implicites et les versions successives du contenu. L’évaluation repose sur un LLM juge et produit une mesure d’exactitude. La comparaison doit toutefois rester prudente, car les scores de la base sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés dans un cadre unique par un tiers.

Avec une médiane de 54 % sur 28 modèles et un meilleur résultat de 78 % pour Nova 2 Pro d’Amazon, le classement fait apparaître des écarts substantiels et une marge de progression. Il ne semble donc pas saturé au sommet des résultats recensés. Sa portée reste ciblée sur des conversations en anglais limitées à dix tours et sur quatre dimensions de continuité conversationnelle. Comme pour tout benchmark publié, une éventuelle contamination des données d’évaluation pourrait réduire la valeur comparative des scores. Multi-Challenge renseigne donc spécifiquement sur la robustesse multi-tours, sans résumer à lui seul l’ensemble des capacités d’un modèle.


Sources des scores : llm-stats.