MRCR v2 (8-needle)

Créé par OpenAI en 2025, MRCR v2 (8-needle) est une variante du benchmark Multi-Round Coreference Resolution consacrée aux très longs contextes. Il demande aux modèles de retrouver plusieurs éléments ciblés, appelés « aiguilles », au sein de conversations étendues contenant des demandes…

Créé par OpenAI en 2025, MRCR v2 (8-needle) est une variante du benchmark Multi-Round Coreference Resolution consacrée aux très longs contextes. Il demande aux modèles de retrouver plusieurs éléments ciblés, appelés « aiguilles », au sein de conversations étendues contenant des demandes dupliquées et des distracteurs.

Le test mesure la capacité à suivre simultanément plusieurs informations identiques, à résoudre leurs coréférences et à restituer l’occurrence demandée dans un contexte pouvant atteindre un million de tokens. Il sert ainsi à comparer la robustesse du raisonnement et de la récupération d’information à longue portée.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesSuivi et raisonnement simultanes sur plusieurs 'aiguilles' identiques dans un tres long contexte (jusqu'a 1M tokens)
ModalitéTexte
Type de questionsRecuperation/coreference long-contexte : retrouver la i-eme occurrence d'une demande dupliquee parmi des distracteurs
Métrique d'évaluationRatio de correspondance de sequence (similarite type SequenceMatcher)
AccèsPublic
Languesanglais
Taille du jeuVariante 8-aiguilles ; 438 entites, 10 formats d'ecriture, 100 echantillons par tranche, 8 tranches de tokens jusqu'a 1M
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (19)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.6 SolOpenAI🔒 Propriétaire91,5 %9 juillet 2026Auto-déclaré
2GPT-5.6 TerraOpenAI🔒 Propriétaire89,6 %9 juillet 2026Auto-déclaré
3Claude Opus 4.6Anthropic🔒 Propriétaire76,0 %5 février 2026Auto-déclaré
4GPT-5.5OpenAI🔒 Propriétaire74,0 %23 avril 2026Auto-déclaré
5Gemma 4 31BGoogle🟢 Ouvert66,4 %2 avril 2026Auto-déclaré
6Gemini 3.1 Flash-LiteGoogle🔒 Propriétaire60,1 %3 mars 2026Auto-déclaré
7Gemma 4 26B-A4BGoogle🟢 Ouvert44,1 %2 avril 2026Auto-déclaré
8Gemma 4 12BGoogle🟢 Ouvert43,4 %23 mai 2026Auto-déclaré
9GPT-5.6 LunaOpenAI🔒 Propriétaire41,3 %9 juillet 2026Auto-déclaré
10GPT-5.4 miniOpenAI🔒 Propriétaire33,6 %17 mars 2026Auto-déclaré
11GPT-5.4 nanoOpenAI🔒 Propriétaire33,1 %17 mars 2026Auto-déclaré
12Gemini 3.5 FlashGoogle🔒 Propriétaire26,6 %19 mai 2026Auto-déclaré
13Gemini 3 ProGoogle🔒 Propriétaire26,3 %18 novembre 2025Auto-déclaré
14Gemini 3.1 Pro PreviewGoogle▫ n.d.26,3 %19 février 2026Auto-déclaré
15Gemma 4 E4BGoogle🟢 Ouvert25,4 %2 avril 2026Auto-déclaré
16Gemini 3 FlashGoogle🔒 Propriétaire22,1 %17 décembre 2025Auto-déclaré
17Gemma 4 E2BGoogle🟢 Ouvert19,1 %2 avril 2026Auto-déclaré
18Gemini 2.5 Pro Preview 06-05Google🔒 Propriétaire16,4 %5 juin 2025Auto-déclaré
19Gemma 3 27BGoogle🟢 Ouvert13,5 %12 mars 2025Auto-déclaré

Classement établi sur 19 modèles évalués, dont 19 de grands éditeurs. Score médian de l'ensemble : 33,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle retrouve avec précision les occurrences demandées malgré leur duplication, les distracteurs et l’allongement du contexte. La métrique repose sur un ratio de correspondance de séquence, de type SequenceMatcher. Elle évalue donc la proximité entre la réponse produite et la séquence attendue, plutôt qu’une appréciation humaine globale du raisonnement.

La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs. Cette provenance rend la comparaison moins homogène qu’une évaluation entièrement conduite par un même tiers. L’accès public au benchmark impose aussi de garder à l’esprit un risque de contamination, sans qu’il puisse être déduit des scores eux-mêmes.

Avec une médiane de 30 % parmi les dix modèles évalués et un meilleur résultat de 76 % pour Claude Opus 4.6, le classement fait apparaître un écart important entre la performance centrale et la tête. Le meilleur score restant inférieur à 100 %, les résultats ne montrent pas de saturation complète. Leur portée demeure ciblée sur la récupération et la coréférence en anglais dans de très longs contextes, et non sur l’ensemble des capacités d’un modèle.


Sources des scores : llm-stats.