MRCR

MRCR, créé par OpenAI en 2025, est une tâche synthétique de raisonnement en contexte long. Il demande aux modèles de parcourir de longues conversations afin de retrouver puis reproduire une sortie précise parmi plusieurs demandes répétées et très similaires.

MRCR, créé par OpenAI en 2025, est une tâche synthétique de raisonnement en contexte long. Il demande aux modèles de parcourir de longues conversations afin de retrouver puis reproduire une sortie précise parmi plusieurs demandes répétées et très similaires.

Le benchmark évalue la compréhension en contexte long, la résolution de coréférence sur plusieurs tours et le raisonnement sur l’ordre des occurrences. Il sert ainsi à mesurer le maintien de l’attention et la capacité de désambiguïsation au fil d’un échange étendu.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesCompréhension en contexte long, résolution de coréférence multi-tours, désambiguïsation entre éléments très similaires
ModalitéTexte
Type de questionsrécupération/reproduction en contexte long (retrouver la i-ème occurrence d'une demande répétée)
Métrique d'évaluationratio de SequenceMatcher (difflib)
AccèsPublic
LicenceMIT
Languesanglais
Taille du jeu2400 exemples (aiguilles à 2, 4 ou 8)
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 2.5 ProGoogle🔒 Propriétaire93,0 %20 mai 2025Auto-déclaré
2Gemini 1.5 ProGoogle🔒 Propriétaire82,6 %1 mai 2024Auto-déclaré
3Gemini 1.5 FlashGoogle🔒 Propriétaire71,9 %1 mai 2024Auto-déclaré
4Gemini 2.0 FlashGoogle🔒 Propriétaire69,2 %21 janvier 2025Auto-déclaré
5Gemini 1.5 Flash 8BGoogle🔒 Propriétaire54,7 %15 mars 2024Auto-déclaré
6MiMo-V2-FlashXiaomi🟢 Ouvert45,7 %16 décembre 2025Auto-déclaré
7Gemini 2.5 FlashGoogle🔒 Propriétaire32,0 %20 mai 2025Auto-déclaré

Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 69,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle retrouve correctement l’occurrence demandée et en reproduit fidèlement le contenu, selon le ratio de similarité SequenceMatcher. Avec 93 %, Gemini 2.5 Pro domine les sept modèles évalués, tandis que la médiane de 69 % montre un écart notable entre le meilleur résultat et la performance centrale du classement. Le sommet élevé peut signaler une saturation partielle pour les modèles les plus performants, sans que l’ensemble du benchmark soit saturé.

La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. L’accès public peut aussi accroître le risque de contamination lors du développement ou de l’évaluation des modèles. Enfin, la portée de MRCR reste ciblée : cette tâche synthétique, en anglais, mesure spécifiquement la récupération et la reproduction dans de longues conversations contenant des requêtes proches. Elle renseigne donc précisément sur la coréférence, l’ordre et la désambiguïsation, plutôt que sur les capacités générales d’un modèle.


Sources des scores : llm-stats.