MRCR v2 (8-needle)
Créé par OpenAI en 2025, MRCR v2 (8-needle) est une variante du benchmark Multi-Round Coreference Resolution consacrée aux très longs contextes. Il demande aux modèles de retrouver plusieurs éléments ciblés, appelés « aiguilles », au sein de conversations étendues contenant des demandes…
Créé par OpenAI en 2025, MRCR v2 (8-needle) est une variante du benchmark Multi-Round Coreference Resolution consacrée aux très longs contextes. Il demande aux modèles de retrouver plusieurs éléments ciblés, appelés « aiguilles », au sein de conversations étendues contenant des demandes dupliquées et des distracteurs.
Le test mesure la capacité à suivre simultanément plusieurs informations identiques, à résoudre leurs coréférences et à restituer l’occurrence demandée dans un contexte pouvant atteindre un million de tokens. Il sert ainsi à comparer la robustesse du raisonnement et de la récupération d’information à longue portée.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | Suivi et raisonnement simultanes sur plusieurs 'aiguilles' identiques dans un tres long contexte (jusqu'a 1M tokens) |
| Modalité | Texte |
| Type de questions | Recuperation/coreference long-contexte : retrouver la i-eme occurrence d'une demande dupliquee parmi des distracteurs |
| Métrique d'évaluation | Ratio de correspondance de sequence (similarite type SequenceMatcher) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | Variante 8-aiguilles ; 438 entites, 10 formats d'ecriture, 100 echantillons par tranche, 8 tranches de tokens jusqu'a 1M |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (19)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 91,5 % | 9 juillet 2026 | Auto-déclaré |
| 2 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 89,6 % | 9 juillet 2026 | Auto-déclaré |
| 3 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 76,0 % | 5 février 2026 | Auto-déclaré |
| 4 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 74,0 % | 23 avril 2026 | Auto-déclaré |
| 5 | Gemma 4 31B | 🟢 Ouvert | 66,4 % | 2 avril 2026 | Auto-déclaré | |
| 6 | Gemini 3.1 Flash-Lite | 🔒 Propriétaire | 60,1 % | 3 mars 2026 | Auto-déclaré | |
| 7 | Gemma 4 26B-A4B | 🟢 Ouvert | 44,1 % | 2 avril 2026 | Auto-déclaré | |
| 8 | Gemma 4 12B | 🟢 Ouvert | 43,4 % | 23 mai 2026 | Auto-déclaré | |
| 9 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 41,3 % | 9 juillet 2026 | Auto-déclaré |
| 10 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 33,6 % | 17 mars 2026 | Auto-déclaré |
| 11 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 33,1 % | 17 mars 2026 | Auto-déclaré |
| 12 | Gemini 3.5 Flash | 🔒 Propriétaire | 26,6 % | 19 mai 2026 | Auto-déclaré | |
| 13 | Gemini 3 Pro | 🔒 Propriétaire | 26,3 % | 18 novembre 2025 | Auto-déclaré | |
| 14 | Gemini 3.1 Pro Preview | ▫ n.d. | 26,3 % | 19 février 2026 | Auto-déclaré | |
| 15 | Gemma 4 E4B | 🟢 Ouvert | 25,4 % | 2 avril 2026 | Auto-déclaré | |
| 16 | Gemini 3 Flash | 🔒 Propriétaire | 22,1 % | 17 décembre 2025 | Auto-déclaré | |
| 17 | Gemma 4 E2B | 🟢 Ouvert | 19,1 % | 2 avril 2026 | Auto-déclaré | |
| 18 | Gemini 2.5 Pro Preview 06-05 | 🔒 Propriétaire | 16,4 % | 5 juin 2025 | Auto-déclaré | |
| 19 | Gemma 3 27B | 🟢 Ouvert | 13,5 % | 12 mars 2025 | Auto-déclaré |
Classement établi sur 19 modèles évalués, dont 19 de grands éditeurs. Score médian de l'ensemble : 33,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle retrouve avec précision les occurrences demandées malgré leur duplication, les distracteurs et l’allongement du contexte. La métrique repose sur un ratio de correspondance de séquence, de type SequenceMatcher. Elle évalue donc la proximité entre la réponse produite et la séquence attendue, plutôt qu’une appréciation humaine globale du raisonnement.
La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs. Cette provenance rend la comparaison moins homogène qu’une évaluation entièrement conduite par un même tiers. L’accès public au benchmark impose aussi de garder à l’esprit un risque de contamination, sans qu’il puisse être déduit des scores eux-mêmes.
Avec une médiane de 30 % parmi les dix modèles évalués et un meilleur résultat de 76 % pour Claude Opus 4.6, le classement fait apparaître un écart important entre la performance centrale et la tête. Le meilleur score restant inférieur à 100 %, les résultats ne montrent pas de saturation complète. Leur portée demeure ciblée sur la récupération et la coréférence en anglais dans de très longs contextes, et non sur l’ensemble des capacités d’un modèle.
Sources des scores : llm-stats.