OpenAI-MRCR: 2 needle 128k

OpenAI-MRCR: 2 needle 128k est un benchmark créé par OpenAI pour évaluer la compréhension en contexte long. Il place plusieurs « aiguilles » identiques dans une conversation synthétique à plusieurs tours, puis demande au modèle de retrouver une occurrence précise d’une requête répétée.

OpenAI-MRCR: 2 needle 128k est un benchmark créé par OpenAI pour évaluer la compréhension en contexte long. Il place plusieurs « aiguilles » identiques dans une conversation synthétique à plusieurs tours, puis demande au modèle de retrouver une occurrence précise d’une requête répétée.

L’épreuve sollicite ainsi la récupération d’information, la résolution de coréférence et la désambiguïsation entre des éléments similaires. Elle vise à distinguer une compréhension structurée de la conversation d’une simple capacité à repérer un contenu isolé dans un long contexte.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesCompréhension en contexte long, distinction entre plusieurs "aiguilles" identiques cachées dans une conversation synthétique multi-tours
ModalitéTexte
Type de questionsrécupération en contexte long / résolution de coréférence multi-tours
Métrique d'évaluationratio SequenceMatcher (difflib), réponse préfixée par un hash
AccèsPublic
LicenceMIT
Languesanglais
Taille du jeu2400 instances au total (configuration 2 aiguilles / contexte 128k)
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (8)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5OpenAI🔒 Propriétaire95,2 %7 août 2025Auto-déclaré
2MiniMax M1MiniMax🟢 Ouvert76,1 %17 juin 2025Auto-déclaré
3GPT-4.1OpenAI🔒 Propriétaire57,2 %14 avril 2025Auto-déclaré
4GPT-4.1 miniOpenAI🔒 Propriétaire47,2 %14 avril 2025Auto-déclaré
5GPT-4.5OpenAI🔒 Propriétaire38,5 %5 mars 2026Auto-déclaré
6GPT-4.1 nanoOpenAI🔒 Propriétaire36,6 %14 avril 2025Auto-déclaré
7GPT-4oOpenAI🔒 Propriétaire31,9 %27 mars 2025Auto-déclaré
8o3-miniOpenAI🔒 Propriétaire18,7 %30 janvier 2025Auto-déclaré

Classement établi sur 8 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 42,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique que le modèle restitue précisément l’instance demandée malgré la répétition de requêtes identiques et la longueur du dialogue. L’évaluation repose sur le ratio SequenceMatcher de difflib, appliqué à une réponse préfixée par un hash. Cette mesure quantifie la proximité avec la réponse attendue, mais ne constitue pas à elle seule une appréciation générale du raisonnement.

Le meilleur résultat, 95 % pour GPT-5, est très supérieur à la médiane de 43 %. Il montre qu’un modèle peut approcher la saturation sur cette configuration, sans établir que l’ensemble des modèles y soit parvenu. La portée reste ciblée : conversations synthétiques en anglais, deux aiguilles, contexte de 128k et tâche de récupération avec coréférence. Le caractère public du benchmark impose aussi de considérer le risque de contamination lors de l’interprétation des performances.

La rigueur comparative est limitée par l’origine des résultats, majoritairement auto-déclarés par les éditeurs. Surtout, sept des huit modèles classés sont édités par OpenAI, également créateur du benchmark. Le classement renseigne donc principalement sur les modèles OpenAI et ne constitue pas une source indépendante pour les comparer à ceux d’autres éditeurs.


Sources des scores : llm-stats.