AA-LCR

AA-LCR, pour Agent Arena Long Context Reasoning benchmark, est un benchmark créé par Artificial Analysis en 2025. Il évalue la capacité des modèles d’IA à raisonner sur de longs contextes et à synthétiser des informations réparties dans plusieurs documents.

AA-LCR, pour Agent Arena Long Context Reasoning benchmark, est un benchmark créé par Artificial Analysis en 2025. Il évalue la capacité des modèles d’IA à raisonner sur de longs contextes et à synthétiser des informations réparties dans plusieurs documents.

Chaque question mobilise environ 100 000 tokens et appelle une réponse ouverte, dont l’équivalence est jugée par un LLM. AA-LCR sert ainsi à comparer les modèles sur une tâche de compréhension et de synthèse à grande échelle, au-delà de la simple restitution d’un élément isolé.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkArtificial Analysis
Capacités mesuréesMesure le raisonnement sur de longs contextes en exigeant la synthèse d'informations dispersées dans plusieurs documents (~100k tokens par question).
ModalitéTexte
Type de questionsquestions ouvertes (réponse libre, jugée par un LLM)
Métrique d'évaluationtaux de réussite moyen (pass/fail, équivalence jugée par un LLM)
AccèsPublic
LicenceApache 2.0
Languesanglais
Taille du jeu100 questions (30 jeux de documents, ~2,98 M tokens)
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (15)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Hy3Tencent🟢 Ouvert73,4 %6 juillet 2026Auto-déclaré
2Mistral Small 4Mistral AI🟢 Ouvert71,2 %16 mars 2026Auto-déclaré
3Kimi K2.5Moonshot AI🟢 Ouvert70,0 %27 janvier 2026Auto-déclaré
4Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert68,7 %16 février 2026Auto-déclaré
5Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire68,3 %31 mars 2026Auto-déclaré
6Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert66,9 %24 février 2026Auto-déclaré
7Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert66,1 %24 février 2026Auto-déclaré
8Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert65,4 %4 juin 2026Auto-déclaré
9Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert63,0 %2 mars 2026Auto-déclaré
10MiniMax M2.1MiniMax🟢 Ouvert62,0 %23 décembre 2025Auto-déclaré
11Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert58,5 %24 février 2026Auto-déclaré
12Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert58,3 %11 mars 2026Auto-déclaré
13Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert57,0 %2 mars 2026Auto-déclaré
14Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert25,6 %2 mars 2026Auto-déclaré
15Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert4,7 %2 mars 2026Auto-déclaré

Classement établi sur 15 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 65,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle fournit plus souvent une réponse jugée équivalente à la réponse attendue après avoir rapproché des informations dispersées dans un vaste corpus documentaire. La mesure repose sur un verdict binaire, réussite ou échec, puis sur un taux moyen. Cette procédure offre un critère homogène, mais dépend du jugement d’un LLM. La fiabilité comparative doit aussi être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante unique.

Le meilleur résultat, obtenu par Mistral Small 4 à 71 %, reste assez éloigné d’un score maximal, ce qui ne signale pas une saturation complète du benchmark. La médiane de 64 % et l’écart limité avec le meilleur modèle montrent toutefois un classement relativement resserré parmi les 14 modèles évalués. La portée reste ciblée sur le raisonnement documentaire en anglais, à partir de 100 questions réparties sur 30 jeux de documents. Son accès public impose enfin de considérer le risque de contamination lors de l’interprétation des performances.


Sources des scores : llm-stats.