MRCR v2

MRCR v2, pour Multi-Round Coreference Resolution version 2, est un benchmark créé par OpenAI afin d’évaluer le raisonnement en très long contexte. Cette version enrichit le cadre MRCR original par des critères d’évaluation améliorés et une complexité accrue.

MRCR v2, pour Multi-Round Coreference Resolution version 2, est un benchmark créé par OpenAI afin d’évaluer le raisonnement en très long contexte. Cette version enrichit le cadre MRCR original par des critères d’évaluation améliorés et une complexité accrue.

À partir de conversations synthétiques à plusieurs tours, MRCR v2 teste la récupération de plusieurs informations disséminées, la coréférence et la désambiguïsation. Il sert ainsi à mesurer la capacité des modèles à maintenir leur attention et à produire la réponse attendue sur des contextes particulièrement étendus.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesRecuperation multi-aiguilles, coreference et desambiguisation en tres long contexte
ModalitéTexte
Type de questionsRecuperation multi-aiguilles en long contexte (conversation synthetique multi-tours)
Métrique d'évaluationScore de correspondance de sequence (ratio) sur la reponse attendue
AccèsPublic
LanguesAnglais (synthetique)
Taille du jeuVariantes 2/4/8 aiguilles jusqu'a 1M tokens
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (8)

#ModèleÉditeurScoreSortieFiabilité
1Qwen3.7-PlusQwen91,7 %31 mai 2026Auto-déclaré
2Gemma 4 31BGoogle66,4 %2 avril 2026Auto-déclaré
3Gemma 4 26B-A4BGoogle44,1 %2 avril 2026Auto-déclaré
4Gemma 4 12BGoogle43,4 %23 mai 2026Auto-déclaré
5DiffusionGemma 26B-A4BGoogle32,0 %10 juin 2026Auto-déclaré
6Gemma 4 E4BGoogle25,4 %2 avril 2026Auto-déclaré
7Gemma 4 E2BGoogle19,1 %2 avril 2026Auto-déclaré
8Gemini 2.5 Flash-LiteGoogle16,6 %17 juin 2025Auto-déclaré

Classement établi sur 8 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 37,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle restitue avec précision la séquence attendue malgré la présence de plusieurs « aiguilles » dans une conversation très longue. La métrique repose sur un ratio de correspondance de séquence, ce qui fournit une mesure directe de la proximité entre réponse produite et réponse cible. La lecture des résultats exige toutefois de distinguer mesure et déclaration : les scores de la base sont majoritairement auto-déclarés par les éditeurs, ce qui réduit l’homogénéité de leur validation.

Le classement montre une forte dispersion : Qwen3.7-Plus atteint 92 %, tandis que la médiane des huit modèles évalués s’établit à 38 %. Cet écart révèle des différences marquées dans la gestion du très long contexte. Le meilleur résultat se rapproche du plafond de la métrique, ce qui peut limiter sa capacité à départager les modèles les plus performants. La portée reste ciblée sur des conversations synthétiques en anglais et sur la récupération multi-aiguilles, la coréférence et la désambiguïsation. Enfin, l’accès public impose de considérer le risque de contamination lors de l’interprétation des performances.


Sources des scores : llm-stats.