MRCR v2
MRCR v2, pour Multi-Round Coreference Resolution version 2, est un benchmark créé par OpenAI afin d’évaluer le raisonnement en très long contexte. Cette version enrichit le cadre MRCR original par des critères d’évaluation améliorés et une complexité accrue.
MRCR v2, pour Multi-Round Coreference Resolution version 2, est un benchmark créé par OpenAI afin d’évaluer le raisonnement en très long contexte. Cette version enrichit le cadre MRCR original par des critères d’évaluation améliorés et une complexité accrue.
À partir de conversations synthétiques à plusieurs tours, MRCR v2 teste la récupération de plusieurs informations disséminées, la coréférence et la désambiguïsation. Il sert ainsi à mesurer la capacité des modèles à maintenir leur attention et à produire la réponse attendue sur des contextes particulièrement étendus.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | Recuperation multi-aiguilles, coreference et desambiguisation en tres long contexte |
| Modalité | Texte |
| Type de questions | Recuperation multi-aiguilles en long contexte (conversation synthetique multi-tours) |
| Métrique d'évaluation | Score de correspondance de sequence (ratio) sur la reponse attendue |
| Accès | Public |
| Langues | Anglais (synthetique) |
| Taille du jeu | Variantes 2/4/8 aiguilles jusqu'a 1M tokens |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (8)
| # | Modèle | Éditeur | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|
| 1 | Qwen3.7-Plus | Qwen | 91,7 % | 31 mai 2026 | Auto-déclaré |
| 2 | Gemma 4 31B | 66,4 % | 2 avril 2026 | Auto-déclaré | |
| 3 | Gemma 4 26B-A4B | 44,1 % | 2 avril 2026 | Auto-déclaré | |
| 4 | Gemma 4 12B | 43,4 % | 23 mai 2026 | Auto-déclaré | |
| 5 | DiffusionGemma 26B-A4B | 32,0 % | 10 juin 2026 | Auto-déclaré | |
| 6 | Gemma 4 E4B | 25,4 % | 2 avril 2026 | Auto-déclaré | |
| 7 | Gemma 4 E2B | 19,1 % | 2 avril 2026 | Auto-déclaré | |
| 8 | Gemini 2.5 Flash-Lite | 16,6 % | 17 juin 2025 | Auto-déclaré |
Classement établi sur 8 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 37,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle restitue avec précision la séquence attendue malgré la présence de plusieurs « aiguilles » dans une conversation très longue. La métrique repose sur un ratio de correspondance de séquence, ce qui fournit une mesure directe de la proximité entre réponse produite et réponse cible. La lecture des résultats exige toutefois de distinguer mesure et déclaration : les scores de la base sont majoritairement auto-déclarés par les éditeurs, ce qui réduit l’homogénéité de leur validation.
Le classement montre une forte dispersion : Qwen3.7-Plus atteint 92 %, tandis que la médiane des huit modèles évalués s’établit à 38 %. Cet écart révèle des différences marquées dans la gestion du très long contexte. Le meilleur résultat se rapproche du plafond de la métrique, ce qui peut limiter sa capacité à départager les modèles les plus performants. La portée reste ciblée sur des conversations synthétiques en anglais et sur la récupération multi-aiguilles, la coréférence et la désambiguïsation. Enfin, l’accès public impose de considérer le risque de contamination lors de l’interprétation des performances.
Sources des scores : llm-stats.