LVBench
LVBench est un benchmark de compréhension de vidéos extrêmement longues, créé en 2024 par Zhipu AI (Z.ai) et Tsinghua University. Il évalue des modèles multimodaux sur des vidéos pouvant atteindre environ deux heures, à travers des questions à choix multiples en anglais.
LVBench est un benchmark de compréhension de vidéos extrêmement longues, créé en 2024 par Zhipu AI (Z.ai) et Tsinghua University. Il évalue des modèles multimodaux sur des vidéos pouvant atteindre environ deux heures, à travers des questions à choix multiples en anglais.
Son objectif est de tester conjointement la vision, le traitement d’un long contexte, la mémoire à long terme et l’extraction d’informations. Il sert ainsi à comparer la capacité des modèles à conserver et mobiliser des éléments pertinents dans des contenus vidéo bien plus longs que ceux des jeux de données habituels.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Zhipu AI (Z.ai) / Tsinghua University |
| Capacités mesurées | compréhension de vidéos longues, multimodal, vision, long contexte, mémoire à long terme, extraction d'information |
| Modalité | Multimodal |
| Type de questions | questions à choix multiples sur la compréhension de vidéos longues (jusqu'à ~2h) |
| Métrique d'évaluation | exactitude (accuracy) sur QCM |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 6 catégories principales et 21 sous-catégories de tâches; vidéos longues (jusqu'à 2h, en moyenne 5x plus longues que les datasets existants) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (23)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 78,0 % | 24 juin 2026 | Auto-déclaré |
| 2 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 76,8 % | 24 juin 2026 | Auto-déclaré |
| 3 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 76,2 % | 31 mai 2026 | Auto-déclaré |
| 4 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 75,9 % | 27 janvier 2026 | Auto-déclaré |
| 5 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 74,4 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,6 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,4 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,4 % | 16 avril 2026 | Auto-déclaré |
| 9 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,7 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,8 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,6 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,6 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,5 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,2 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,0 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 56,2 % | 22 septembre 2025 | Auto-déclaré |
| 17 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 55,8 % | 22 septembre 2025 | Auto-déclaré |
| 18 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 53,5 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 49,0 % | 28 février 2025 | Auto-déclaré |
| 20 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 47,3 % | 26 janvier 2025 | Auto-déclaré |
| 21 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 45,3 % | 26 janvier 2025 | Auto-déclaré |
| 22 | Nova Pro | Amazon | 🔒 Propriétaire | 41,6 % | 20 novembre 2024 | Auto-déclaré |
| 23 | Nova Lite | Amazon | 🔒 Propriétaire | 40,4 % | 20 novembre 2024 | Auto-déclaré |
Classement établi sur 23 modèles évalués, dont 2 de grands éditeurs. Score médian de l'ensemble : 62,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur LVBench indique une meilleure exactitude aux QCM portant sur des vidéos longues. Il traduit donc une capacité accrue à repérer, mémoriser et relier des informations réparties dans un contexte multimodal étendu. Dans la base, Seed 2.1 Pro arrive en tête avec 78 %, tandis que la médiane des 23 modèles évalués atteint 63 %. Cet écart montre une hiérarchie encore visible entre les systèmes et ne suggère pas une saturation complète du benchmark.
La lecture du classement doit toutefois rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant unique. L’accès public peut aussi accroître le risque qu’un benchmark soit intégré, directement ou indirectement, aux données ou aux pratiques d’optimisation des modèles. Enfin, la portée de LVBench reste ciblée : il mesure l’exactitude sur des QCM en anglais consacrés à la compréhension de vidéos longues. Le classement renseigne donc sur cette aptitude précise, sans constituer une mesure générale de toutes les capacités multimodales.
Sources des scores : llm-stats.