OpenAI-MRCR: 2 needle 128k
OpenAI-MRCR: 2 needle 128k est un benchmark créé par OpenAI pour évaluer la compréhension en contexte long. Il place plusieurs « aiguilles » identiques dans une conversation synthétique à plusieurs tours, puis demande au modèle de retrouver une occurrence précise d’une requête répétée.
OpenAI-MRCR: 2 needle 128k est un benchmark créé par OpenAI pour évaluer la compréhension en contexte long. Il place plusieurs « aiguilles » identiques dans une conversation synthétique à plusieurs tours, puis demande au modèle de retrouver une occurrence précise d’une requête répétée.
L’épreuve sollicite ainsi la récupération d’information, la résolution de coréférence et la désambiguïsation entre des éléments similaires. Elle vise à distinguer une compréhension structurée de la conversation d’une simple capacité à repérer un contenu isolé dans un long contexte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | Compréhension en contexte long, distinction entre plusieurs "aiguilles" identiques cachées dans une conversation synthétique multi-tours |
| Modalité | Texte |
| Type de questions | récupération en contexte long / résolution de coréférence multi-tours |
| Métrique d'évaluation | ratio SequenceMatcher (difflib), réponse préfixée par un hash |
| Accès | Public |
| Licence | MIT |
| Langues | anglais |
| Taille du jeu | 2400 instances au total (configuration 2 aiguilles / contexte 128k) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (8)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5 | OpenAI | 🔒 Propriétaire | 95,2 % | 7 août 2025 | Auto-déclaré |
| 2 | MiniMax M1 | MiniMax | 🟢 Ouvert | 76,1 % | 17 juin 2025 | Auto-déclaré |
| 3 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 57,2 % | 14 avril 2025 | Auto-déclaré |
| 4 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 47,2 % | 14 avril 2025 | Auto-déclaré |
| 5 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 38,5 % | 5 mars 2026 | Auto-déclaré |
| 6 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 36,6 % | 14 avril 2025 | Auto-déclaré |
| 7 | GPT-4o | OpenAI | 🔒 Propriétaire | 31,9 % | 27 mars 2025 | Auto-déclaré |
| 8 | o3-mini | OpenAI | 🔒 Propriétaire | 18,7 % | 30 janvier 2025 | Auto-déclaré |
Classement établi sur 8 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 42,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique que le modèle restitue précisément l’instance demandée malgré la répétition de requêtes identiques et la longueur du dialogue. L’évaluation repose sur le ratio SequenceMatcher de difflib, appliqué à une réponse préfixée par un hash. Cette mesure quantifie la proximité avec la réponse attendue, mais ne constitue pas à elle seule une appréciation générale du raisonnement.
Le meilleur résultat, 95 % pour GPT-5, est très supérieur à la médiane de 43 %. Il montre qu’un modèle peut approcher la saturation sur cette configuration, sans établir que l’ensemble des modèles y soit parvenu. La portée reste ciblée : conversations synthétiques en anglais, deux aiguilles, contexte de 128k et tâche de récupération avec coréférence. Le caractère public du benchmark impose aussi de considérer le risque de contamination lors de l’interprétation des performances.
La rigueur comparative est limitée par l’origine des résultats, majoritairement auto-déclarés par les éditeurs. Surtout, sept des huit modèles classés sont édités par OpenAI, également créateur du benchmark. Le classement renseigne donc principalement sur les modèles OpenAI et ne constitue pas une source indépendante pour les comparer à ceux d’autres éditeurs.
Sources des scores : llm-stats.