LongBench v2
LongBench v2 est un benchmark créé par THUDM (Tsinghua University) et d’autres contributeurs pour évaluer la capacité des grands modèles de langage à traiter des contextes très longs. Il privilégie des problèmes réalistes exigeant compréhension approfondie et raisonnement.
LongBench v2 est un benchmark créé par THUDM (Tsinghua University) et d’autres contributeurs pour évaluer la capacité des grands modèles de langage à traiter des contextes très longs. Il privilégie des problèmes réalistes exigeant compréhension approfondie et raisonnement.
Ses tâches couvrent notamment les questions sur un ou plusieurs documents, l’apprentissage en contexte, les dialogues longs, les dépôts de code et les données structurées. Ce périmètre permet de comparer la manière dont les modèles mobilisent des informations dispersées dans des volumes de contexte particulièrement importants.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | THUDM (Tsinghua University) et al. |
| Capacités mesurées | généraliste, contexte long, raisonnement, sortie structurée |
| Modalité | Texte |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 503 questions |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (15)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,2 % | 16 février 2026 | Auto-déclaré |
| 2 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 62,0 % | 31 mars 2026 | Auto-déclaré |
| 3 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 61,9 % | 4 juin 2026 | Auto-déclaré |
| 4 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 61,0 % | 27 janvier 2026 | Auto-déclaré |
| 5 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 61,0 % | 2 juin 2026 | Auto-déclaré |
| 6 | MiniMax M1 | MiniMax | 🟢 Ouvert | 61,0 % | 17 juin 2025 | Auto-déclaré |
| 7 | MiMo-V2-Flash | Xiaomi | 🟢 Ouvert | 60,6 % | 16 décembre 2025 | Auto-déclaré |
| 8 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,6 % | 24 février 2026 | Auto-déclaré |
| 9 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,2 % | 24 février 2026 | Auto-déclaré |
| 10 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,0 % | 24 février 2026 | Auto-déclaré |
| 11 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 55,2 % | 2 mars 2026 | Auto-déclaré |
| 12 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 50,0 % | 2 mars 2026 | Auto-déclaré |
| 13 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 48,7 % | 25 décembre 2024 | Auto-déclaré |
| 14 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 38,7 % | 2 mars 2026 | Auto-déclaré |
| 15 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 26,1 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 15 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 60,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur LongBench v2 correspond à une forte proportion de réponses correctes aux QCM. Il indique qu’un modèle parvient à retrouver, relier et exploiter des informations dans de longs contextes, sur plusieurs formes de contenus et de raisonnement. L’interprétation doit toutefois tenir compte du protocole de remontée des résultats : les scores de la base sont majoritairement auto-déclarés par les éditeurs, ce qui offre une garantie de comparabilité moins forte qu’une évaluation entièrement mesurée de manière indépendante.
Parmi les 15 modèles évalués, Qwen3.5-397B-A17B arrive en tête à 63 %, contre une médiane de 61 %. Ce faible écart suggère une différenciation limitée dans cette zone du classement et un possible début de saturation, sans signifier que les tâches sont résolues dans leur ensemble. Le caractère public du benchmark crée aussi un risque de contamination par exposition aux questions. Enfin, sa portée reste celle de QCM en anglais, centrés sur six catégories de tâches à contexte long, et ne résume donc pas toutes les capacités d’un modèle.
Sources des scores : llm-stats.