LongBench v2
LongBench v2 est un benchmark créé par THUDM (Tsinghua University) et d’autres contributeurs pour évaluer la capacité des grands modèles de langage à traiter des contextes très longs. Il privilégie des problèmes réalistes exigeant compréhension approfondie et raisonnement.