OpenAI-MRCR: 2 needle 1M
OpenAI-MRCR: 2 needle 1M est un benchmark créé par OpenAI pour évaluer les modèles de langage confrontés à de très longues conversations synthétiques en anglais. Il cible la résolution de coréférence sur plusieurs tours, lorsque plusieurs contenus similaires sont disséminés dans le…
OpenAI-MRCR: 2 needle 1M est un benchmark créé par OpenAI pour évaluer les modèles de langage confrontés à de très longues conversations synthétiques en anglais. Il cible la résolution de coréférence sur plusieurs tours, lorsque plusieurs contenus similaires sont disséminés dans le contexte.
Le modèle doit retrouver puis restituer une occurrence précise, par exemple le deuxième poème consacré aux tapirs. L’épreuve mesure ainsi la capacité à suivre l’ordre des échanges, à distinguer des réponses très proches et à mobiliser efficacement un contexte pouvant approcher un million de tokens.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | Capacité d'un LLM en long contexte à distinguer plusieurs 'aiguilles' similaires cachées dans une longue conversation et à restituer une instance précise demandée. |
| Modalité | Texte |
| Type de questions | Long contexte / résolution de coréférence multi-tours (multi-round co-reference resolution) |
| Métrique d'évaluation | Ratio SequenceMatcher (difflib) avec préfixe de hash requis |
| Accès | Public |
| Licence | MIT |
| Langues | Anglais |
| Taille du jeu | 100 échantillons par bin sur 8 bins de tokens jusqu'à ~1 048 576 tokens ; 438 entités, 10 formats d'écriture |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (4)
| # | Modèle | Éditeur | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|
| 1 | MiniMax M1 | MiniMax | 58,6 % | 17 juin 2025 | Auto-déclaré |
| 2 | GPT-4.1 | OpenAI | 46,3 % | 14 avril 2025 | Auto-déclaré |
| 3 | GPT-4.1 mini | OpenAI | 33,3 % | 14 avril 2025 | Auto-déclaré |
| 4 | GPT-4.1 nano | OpenAI | 12,0 % | 14 avril 2025 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 39,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle reproduit avec précision l’instance demandée malgré la présence de plusieurs « aiguilles » similaires. La métrique compare les séquences avec SequenceMatcher et impose un préfixe de hash, ce qui valorise la fidélité de la restitution, au-delà d’une réponse simplement plausible. La rigueur d’interprétation reste toutefois contrainte par l’origine des résultats, majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante.
Le meilleur résultat observé, 59 % pour MiniMax M1, et la médiane de 40 % parmi les quatre modèles évalués signalent une marge de progression importante plutôt qu’une saturation du benchmark. Le classement met surtout en évidence des écarts de robustesse dans le suivi de conversations très longues et la discrimination de contenus proches. Sa portée demeure ciblée sur des échanges synthétiques en anglais, avec 438 entités et 10 formats d’écriture. Les scores ne résument donc pas les capacités générales d’un modèle. Le caractère public du jeu appelle aussi à considérer le risque de contamination lors de l’interprétation de futures performances.
Sources des scores : llm-stats.