OpenAI-MRCR: 2 needle 1M

OpenAI-MRCR: 2 needle 1M est un benchmark créé par OpenAI pour évaluer les modèles de langage confrontés à de très longues conversations synthétiques en anglais. Il cible la résolution de coréférence sur plusieurs tours, lorsque plusieurs contenus similaires sont disséminés dans le…

OpenAI-MRCR: 2 needle 1M est un benchmark créé par OpenAI pour évaluer les modèles de langage confrontés à de très longues conversations synthétiques en anglais. Il cible la résolution de coréférence sur plusieurs tours, lorsque plusieurs contenus similaires sont disséminés dans le contexte.

Le modèle doit retrouver puis restituer une occurrence précise, par exemple le deuxième poème consacré aux tapirs. L’épreuve mesure ainsi la capacité à suivre l’ordre des échanges, à distinguer des réponses très proches et à mobiliser efficacement un contexte pouvant approcher un million de tokens.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesCapacité d'un LLM en long contexte à distinguer plusieurs 'aiguilles' similaires cachées dans une longue conversation et à restituer une instance précise demandée.
ModalitéTexte
Type de questionsLong contexte / résolution de coréférence multi-tours (multi-round co-reference resolution)
Métrique d'évaluationRatio SequenceMatcher (difflib) avec préfixe de hash requis
AccèsPublic
LicenceMIT
LanguesAnglais
Taille du jeu100 échantillons par bin sur 8 bins de tokens jusqu'à ~1 048 576 tokens ; 438 entités, 10 formats d'écriture
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (4)

#ModèleÉditeurScoreSortieFiabilité
1MiniMax M1MiniMax58,6 %17 juin 2025Auto-déclaré
2GPT-4.1OpenAI46,3 %14 avril 2025Auto-déclaré
3GPT-4.1 miniOpenAI33,3 %14 avril 2025Auto-déclaré
4GPT-4.1 nanoOpenAI12,0 %14 avril 2025Auto-déclaré

Classement établi sur 4 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 39,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle reproduit avec précision l’instance demandée malgré la présence de plusieurs « aiguilles » similaires. La métrique compare les séquences avec SequenceMatcher et impose un préfixe de hash, ce qui valorise la fidélité de la restitution, au-delà d’une réponse simplement plausible. La rigueur d’interprétation reste toutefois contrainte par l’origine des résultats, majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante.

Le meilleur résultat observé, 59 % pour MiniMax M1, et la médiane de 40 % parmi les quatre modèles évalués signalent une marge de progression importante plutôt qu’une saturation du benchmark. Le classement met surtout en évidence des écarts de robustesse dans le suivi de conversations très longues et la discrimination de contenus proches. Sa portée demeure ciblée sur des échanges synthétiques en anglais, avec 438 entités et 10 formats d’écriture. Les scores ne résument donc pas les capacités générales d’un modèle. Le caractère public du jeu appelle aussi à considérer le risque de contamination lors de l’interprétation de futures performances.


Sources des scores : llm-stats.