AA-LCR
AA-LCR, pour Agent Arena Long Context Reasoning benchmark, est un benchmark créé par Artificial Analysis en 2025. Il évalue la capacité des modèles d’IA à raisonner sur de longs contextes et à synthétiser des informations réparties dans plusieurs documents.
AA-LCR, pour Agent Arena Long Context Reasoning benchmark, est un benchmark créé par Artificial Analysis en 2025. Il évalue la capacité des modèles d’IA à raisonner sur de longs contextes et à synthétiser des informations réparties dans plusieurs documents.
Chaque question mobilise environ 100 000 tokens et appelle une réponse ouverte, dont l’équivalence est jugée par un LLM. AA-LCR sert ainsi à comparer les modèles sur une tâche de compréhension et de synthèse à grande échelle, au-delà de la simple restitution d’un élément isolé.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Artificial Analysis |
| Capacités mesurées | Mesure le raisonnement sur de longs contextes en exigeant la synthèse d'informations dispersées dans plusieurs documents (~100k tokens par question). |
| Modalité | Texte |
| Type de questions | questions ouvertes (réponse libre, jugée par un LLM) |
| Métrique d'évaluation | taux de réussite moyen (pass/fail, équivalence jugée par un LLM) |
| Accès | Public |
| Licence | Apache 2.0 |
| Langues | anglais |
| Taille du jeu | 100 questions (30 jeux de documents, ~2,98 M tokens) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (15)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Hy3 | Tencent | 🟢 Ouvert | 73,4 % | 6 juillet 2026 | Auto-déclaré |
| 2 | Mistral Small 4 | Mistral AI | 🟢 Ouvert | 71,2 % | 16 mars 2026 | Auto-déclaré |
| 3 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 70,0 % | 27 janvier 2026 | Auto-déclaré |
| 4 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,7 % | 16 février 2026 | Auto-déclaré |
| 5 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 68,3 % | 31 mars 2026 | Auto-déclaré |
| 6 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,9 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,1 % | 24 février 2026 | Auto-déclaré |
| 8 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 65,4 % | 4 juin 2026 | Auto-déclaré |
| 9 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,0 % | 2 mars 2026 | Auto-déclaré |
| 10 | MiniMax M2.1 | MiniMax | 🟢 Ouvert | 62,0 % | 23 décembre 2025 | Auto-déclaré |
| 11 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,5 % | 24 février 2026 | Auto-déclaré |
| 12 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 58,3 % | 11 mars 2026 | Auto-déclaré |
| 13 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,0 % | 2 mars 2026 | Auto-déclaré |
| 14 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 25,6 % | 2 mars 2026 | Auto-déclaré |
| 15 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 4,7 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 15 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 65,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle fournit plus souvent une réponse jugée équivalente à la réponse attendue après avoir rapproché des informations dispersées dans un vaste corpus documentaire. La mesure repose sur un verdict binaire, réussite ou échec, puis sur un taux moyen. Cette procédure offre un critère homogène, mais dépend du jugement d’un LLM. La fiabilité comparative doit aussi être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante unique.
Le meilleur résultat, obtenu par Mistral Small 4 à 71 %, reste assez éloigné d’un score maximal, ce qui ne signale pas une saturation complète du benchmark. La médiane de 64 % et l’écart limité avec le meilleur modèle montrent toutefois un classement relativement resserré parmi les 14 modèles évalués. La portée reste ciblée sur le raisonnement documentaire en anglais, à partir de 100 questions réparties sur 30 jeux de documents. Son accès public impose enfin de considérer le risque de contamination lors de l’interprétation des performances.
Sources des scores : llm-stats.