MRCR
MRCR, créé par OpenAI en 2025, est une tâche synthétique de raisonnement en contexte long. Il demande aux modèles de parcourir de longues conversations afin de retrouver puis reproduire une sortie précise parmi plusieurs demandes répétées et très similaires.
MRCR, créé par OpenAI en 2025, est une tâche synthétique de raisonnement en contexte long. Il demande aux modèles de parcourir de longues conversations afin de retrouver puis reproduire une sortie précise parmi plusieurs demandes répétées et très similaires.
Le benchmark évalue la compréhension en contexte long, la résolution de coréférence sur plusieurs tours et le raisonnement sur l’ordre des occurrences. Il sert ainsi à mesurer le maintien de l’attention et la capacité de désambiguïsation au fil d’un échange étendu.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | Compréhension en contexte long, résolution de coréférence multi-tours, désambiguïsation entre éléments très similaires |
| Modalité | Texte |
| Type de questions | récupération/reproduction en contexte long (retrouver la i-ème occurrence d'une demande répétée) |
| Métrique d'évaluation | ratio de SequenceMatcher (difflib) |
| Accès | Public |
| Licence | MIT |
| Langues | anglais |
| Taille du jeu | 2400 exemples (aiguilles à 2, 4 ou 8) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 2.5 Pro | 🔒 Propriétaire | 93,0 % | 20 mai 2025 | Auto-déclaré | |
| 2 | Gemini 1.5 Pro | 🔒 Propriétaire | 82,6 % | 1 mai 2024 | Auto-déclaré | |
| 3 | Gemini 1.5 Flash | 🔒 Propriétaire | 71,9 % | 1 mai 2024 | Auto-déclaré | |
| 4 | Gemini 2.0 Flash | 🔒 Propriétaire | 69,2 % | 21 janvier 2025 | Auto-déclaré | |
| 5 | Gemini 1.5 Flash 8B | 🔒 Propriétaire | 54,7 % | 15 mars 2024 | Auto-déclaré | |
| 6 | MiMo-V2-Flash | Xiaomi | 🟢 Ouvert | 45,7 % | 16 décembre 2025 | Auto-déclaré |
| 7 | Gemini 2.5 Flash | 🔒 Propriétaire | 32,0 % | 20 mai 2025 | Auto-déclaré |
Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 69,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle retrouve correctement l’occurrence demandée et en reproduit fidèlement le contenu, selon le ratio de similarité SequenceMatcher. Avec 93 %, Gemini 2.5 Pro domine les sept modèles évalués, tandis que la médiane de 69 % montre un écart notable entre le meilleur résultat et la performance centrale du classement. Le sommet élevé peut signaler une saturation partielle pour les modèles les plus performants, sans que l’ensemble du benchmark soit saturé.
La lecture du classement exige toutefois de la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. L’accès public peut aussi accroître le risque de contamination lors du développement ou de l’évaluation des modèles. Enfin, la portée de MRCR reste ciblée : cette tâche synthétique, en anglais, mesure spécifiquement la récupération et la reproduction dans de longues conversations contenant des requêtes proches. Elle renseigne donc précisément sur la coréférence, l’ordre et la désambiguïsation, plutôt que sur les capacités générales d’un modèle.
Sources des scores : llm-stats.