VITA-Bench
VITA-Bench est un benchmark créé par Meituan LongCat pour évaluer l’automatisation de tâches virtuelles inspirées de situations réelles. Il confronte des agents d’IA à des parcours interactifs en plusieurs étapes, qui nécessitent des appels d’outils dans un environnement simulé.
VITA-Bench est un benchmark créé par Meituan LongCat pour évaluer l’automatisation de tâches virtuelles inspirées de situations réelles. Il confronte des agents d’IA à des parcours interactifs en plusieurs étapes, qui nécessitent des appels d’outils dans un environnement simulé.
Son évaluation porte sur des activités variées, notamment la livraison de repas, la consommation en magasin et les voyages en ligne. La composition flexible de scénarios et d’outils permet d’observer la capacité des modèles à planifier, enchaîner des actions et mener une tâche complexe à son terme.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Meituan LongCat |
| Capacités mesurées | Automatisation de taches reelles versatiles : livraison de repas, consommation en magasin, voyages en ligne ; composition flexible de scenarios et d'outils |
| Modalité | Texte |
| Type de questions | Taches interactives multi-etapes pour agents avec appels d'outils (environnement simule) |
| Métrique d'évaluation | Taux de reussite (success rate) via evaluateur a fenetre glissante base sur rubriques |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 100 taches inter-scenarios + 300 taches mono-scenario, 66 outils |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (10)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 49,7 % | 16 février 2026 | Auto-déclaré |
| 2 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 47,9 % | 19 mai 2026 | Auto-déclaré |
| 3 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 45,6 % | 31 mai 2026 | Auto-déclaré |
| 4 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 44,3 % | 31 mars 2026 | Auto-déclaré |
| 5 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 41,9 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 35,6 % | 16 avril 2026 | Auto-déclaré |
| 7 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 33,6 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 31,9 % | 24 février 2026 | Auto-déclaré |
| 9 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 29,8 % | 2 mars 2026 | Auto-déclaré |
| 10 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 22,0 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 10 modèles évalués. Score médian de l'ensemble : 38,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un agent réussit fréquemment les tâches proposées, en coordonnant plusieurs étapes et appels d’outils selon les rubriques de l’évaluateur à fenêtre glissante. Le taux de réussite mesure donc une exécution complète dans l’environnement simulé, plutôt qu’une simple réponse isolée. La fiabilité comparative reste à considérer avec prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs, et non tous mesurés dans un cadre indépendant uniforme.
Le classement ne paraît pas saturé au sommet : Qwen3.5-397B-A17B atteint 50 %, contre une médiane de 39 % parmi les dix modèles évalués. Cet écart révèle un avantage du premier modèle, mais aussi une marge de progression générale sur ces tâches. La portée demeure circonscrite à des scénarios simulés, en anglais, couvrant les domaines représentés par VITA-Bench. Son accès public peut également accroître le risque de contamination au fil du temps, ce qui invite à distinguer performance au benchmark et capacité générale d’automatisation dans d’autres environnements.
Sources des scores : llm-stats.