LongBench v2

LongBench v2 est un benchmark créé par THUDM (Tsinghua University) et d’autres contributeurs pour évaluer la capacité des grands modèles de langage à traiter des contextes très longs. Il privilégie des problèmes réalistes exigeant compréhension approfondie et raisonnement.

LongBench v2 est un benchmark créé par THUDM (Tsinghua University) et d’autres contributeurs pour évaluer la capacité des grands modèles de langage à traiter des contextes très longs. Il privilégie des problèmes réalistes exigeant compréhension approfondie et raisonnement.

Ses tâches couvrent notamment les questions sur un ou plusieurs documents, l’apprentissage en contexte, les dialogues longs, les dépôts de code et les données structurées. Ce périmètre permet de comparer la manière dont les modèles mobilisent des informations dispersées dans des volumes de contexte particulièrement importants.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkTHUDM (Tsinghua University) et al.
Capacités mesuréesgénéraliste, contexte long, raisonnement, sortie structurée
ModalitéTexte
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu503 questions
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (15)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert63,2 %16 février 2026Auto-déclaré
2Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire62,0 %31 mars 2026Auto-déclaré
3Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert61,9 %4 juin 2026Auto-déclaré
4Kimi K2.5Moonshot AI🟢 Ouvert61,0 %27 janvier 2026Auto-déclaré
5MAI-Thinking-1Microsoft🔒 Propriétaire61,0 %2 juin 2026Auto-déclaré
6MiniMax M1MiniMax🟢 Ouvert61,0 %17 juin 2025Auto-déclaré
7MiMo-V2-FlashXiaomi🟢 Ouvert60,6 %16 décembre 2025Auto-déclaré
8Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert60,6 %24 février 2026Auto-déclaré
9Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert60,2 %24 février 2026Auto-déclaré
10Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert59,0 %24 février 2026Auto-déclaré
11Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert55,2 %2 mars 2026Auto-déclaré
12Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert50,0 %2 mars 2026Auto-déclaré
13DeepSeek-V3DeepSeek🟢 Ouvert48,7 %25 décembre 2024Auto-déclaré
14Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert38,7 %2 mars 2026Auto-déclaré
15Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert26,1 %2 mars 2026Auto-déclaré

Classement établi sur 15 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 60,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur LongBench v2 correspond à une forte proportion de réponses correctes aux QCM. Il indique qu’un modèle parvient à retrouver, relier et exploiter des informations dans de longs contextes, sur plusieurs formes de contenus et de raisonnement. L’interprétation doit toutefois tenir compte du protocole de remontée des résultats : les scores de la base sont majoritairement auto-déclarés par les éditeurs, ce qui offre une garantie de comparabilité moins forte qu’une évaluation entièrement mesurée de manière indépendante.

Parmi les 15 modèles évalués, Qwen3.5-397B-A17B arrive en tête à 63 %, contre une médiane de 61 %. Ce faible écart suggère une différenciation limitée dans cette zone du classement et un possible début de saturation, sans signifier que les tâches sont résolues dans leur ensemble. Le caractère public du benchmark crée aussi un risque de contamination par exposition aux questions. Enfin, sa portée reste celle de QCM en anglais, centrés sur six catégories de tâches à contexte long, et ne résume donc pas toutes les capacités d’un modèle.


Sources des scores : llm-stats.