DeepPlanning
DeepPlanning est un benchmark public créé en 2026 par la Qwen Team d’Alibaba, notamment Junyang Lin et ses coauteurs. Il évalue des modèles de langage sur des tâches agentiques complexes nécessitant une planification en plusieurs étapes et un raisonnement à long horizon.
DeepPlanning est un benchmark public créé en 2026 par la Qwen Team d’Alibaba, notamment Junyang Lin et ses coauteurs. Il évalue des modèles de langage sur des tâches agentiques complexes nécessitant une planification en plusieurs étapes et un raisonnement à long horizon.
Les scénarios, comme l’organisation de voyages sur plusieurs jours ou d’achats multi-produits, sollicitent la collecte proactive d’informations, le raisonnement local sous contraintes et l’optimisation globale de budgets de temps ou d’argent. DeepPlanning sert ainsi à mesurer la capacité des modèles à décomposer un objectif et à élaborer une stratégie réalisable.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Qwen Team, Alibaba (Junyang Lin et al.) |
| Capacités mesurées | Planification agentique long-horizon : acquisition proactive d'information, raisonnement local sous contraintes, optimisation globale (budgets temps/argent) |
| Modalité | Texte |
| Type de questions | Taches agentiques de planification long-horizon (voyage multi-jours, achats multi-produits) |
| Métrique d'évaluation | Taux de reussite sous contraintes verifiables |
| Accès | Public |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (9)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 62,3 % | 31 mai 2026 | Auto-déclaré |
| 2 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 41,5 % | 31 mars 2026 | Auto-déclaré |
| 3 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 34,3 % | 16 février 2026 | Auto-déclaré |
| 4 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 25,9 % | 16 avril 2026 | Auto-déclaré |
| 5 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 24,1 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 22,8 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 22,6 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 18,0 % | 2 mars 2026 | Auto-déclaré |
| 9 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 17,6 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 9 modèles évalués. Score médian de l'ensemble : 24,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle mène plus souvent à bien des plans complexes tout en respectant les contraintes vérifiables du scénario. La médiane de 24 % et le meilleur résultat de 62 %, obtenu par Qwen3.7-Plus, montrent que DeepPlanning n’est pas saturé parmi les neuf modèles évalués dans cette base et qu’il reste discriminant sur ces tâches. La métrique repose sur une réussite mesurable, mais la rigueur comparative est limitée par des scores majoritairement auto-déclarés par les éditeurs, plutôt que produits dans une évaluation indépendante uniforme. L’accès public peut aussi accroître, avec le temps, le risque de familiarisation ou de contamination des modèles par le contenu du benchmark. Sa portée demeure centrée sur deux familles de tâches agentiques, les voyages multi-jours et les achats multi-produits, et ne résume donc pas l’ensemble des capacités de planification. Enfin, le classement révèle uniquement des écarts internes à l’écosystème Qwen : les neuf modèles classés sont édités par Qwen, qui a également codéveloppé DeepPlanning. Il ne constitue donc pas une comparaison indépendante entre Qwen et d’autres éditeurs.
Sources des scores : llm-stats.