DeepPlanning

DeepPlanning est un benchmark public créé en 2026 par la Qwen Team d’Alibaba, notamment Junyang Lin et ses coauteurs. Il évalue des modèles de langage sur des tâches agentiques complexes nécessitant une planification en plusieurs étapes et un raisonnement à long horizon.

DeepPlanning est un benchmark public créé en 2026 par la Qwen Team d’Alibaba, notamment Junyang Lin et ses coauteurs. Il évalue des modèles de langage sur des tâches agentiques complexes nécessitant une planification en plusieurs étapes et un raisonnement à long horizon.

Les scénarios, comme l’organisation de voyages sur plusieurs jours ou d’achats multi-produits, sollicitent la collecte proactive d’informations, le raisonnement local sous contraintes et l’optimisation globale de budgets de temps ou d’argent. DeepPlanning sert ainsi à mesurer la capacité des modèles à décomposer un objectif et à élaborer une stratégie réalisable.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkQwen Team, Alibaba (Junyang Lin et al.)
Capacités mesuréesPlanification agentique long-horizon : acquisition proactive d'information, raisonnement local sous contraintes, optimisation globale (budgets temps/argent)
ModalitéTexte
Type de questionsTaches agentiques de planification long-horizon (voyage multi-jours, achats multi-produits)
Métrique d'évaluationTaux de reussite sous contraintes verifiables
AccèsPublic
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (9)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire62,3 %31 mai 2026Auto-déclaré
2Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire41,5 %31 mars 2026Auto-déclaré
3Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert34,3 %16 février 2026Auto-déclaré
4Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert25,9 %16 avril 2026Auto-déclaré
5Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert24,1 %24 février 2026Auto-déclaré
6Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert22,8 %24 février 2026Auto-déclaré
7Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert22,6 %24 février 2026Auto-déclaré
8Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert18,0 %2 mars 2026Auto-déclaré
9Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert17,6 %2 mars 2026Auto-déclaré

Classement établi sur 9 modèles évalués. Score médian de l'ensemble : 24,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle mène plus souvent à bien des plans complexes tout en respectant les contraintes vérifiables du scénario. La médiane de 24 % et le meilleur résultat de 62 %, obtenu par Qwen3.7-Plus, montrent que DeepPlanning n’est pas saturé parmi les neuf modèles évalués dans cette base et qu’il reste discriminant sur ces tâches. La métrique repose sur une réussite mesurable, mais la rigueur comparative est limitée par des scores majoritairement auto-déclarés par les éditeurs, plutôt que produits dans une évaluation indépendante uniforme. L’accès public peut aussi accroître, avec le temps, le risque de familiarisation ou de contamination des modèles par le contenu du benchmark. Sa portée demeure centrée sur deux familles de tâches agentiques, les voyages multi-jours et les achats multi-produits, et ne résume donc pas l’ensemble des capacités de planification. Enfin, le classement révèle uniquement des écarts internes à l’écosystème Qwen : les neuf modèles classés sont édités par Qwen, qui a également codéveloppé DeepPlanning. Il ne constitue donc pas une comparaison indépendante entre Qwen et d’autres éditeurs.


Sources des scores : llm-stats.