RULER
RULER est un benchmark synthétique conçu par NVIDIA pour évaluer les modèles confrontés à de très longs contextes. Ses tâches en anglais couvrent la récupération d’information, le suivi multi-sauts, l’agrégation et la question-réponse, avec des réponses courtes ou structurées.
RULER est un benchmark synthétique conçu par NVIDIA pour évaluer les modèles confrontés à de très longs contextes. Ses tâches en anglais couvrent la récupération d’information, le suivi multi-sauts, l’agrégation et la question-réponse, avec des réponses courtes ou structurées.
Son objectif est d’observer comment la qualité d’un modèle évolue lorsque la longueur d’entrée augmente. RULER complète ainsi l’évaluation des capacités en contexte long en mesurant non seulement la réussite aux tâches, mais aussi la dégradation progressive des performances.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | NVIDIA |
| Capacités mesurées | contexte long, raisonnement |
| Modalité | Texte |
| Type de questions | tâches synthétiques de contexte long avec réponses courtes ou structurées |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | anglais |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (4)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 94,7 % | 4 juin 2026 | Auto-déclaré |
| 2 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 91,8 % | 11 mars 2026 | Auto-déclaré |
| 3 | Phi-3.5-MoE-instruct | Microsoft | 🟢 Ouvert | 87,1 % | 23 août 2024 | Auto-déclaré |
| 4 | Phi-3.5-mini-instruct | Microsoft | 🟢 Ouvert | 84,1 % | 23 août 2024 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 89,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle restitue avec précision les réponses attendues dans les tâches synthétiques de RULER et exploite efficacement les informations présentes dans de longs contextes. Il traduit aussi une meilleure résistance à l’allongement des entrées sur les dimensions évaluées. Le classement montre un niveau globalement élevé parmi les quatre modèles recensés, avec une médiane de 89 %. Nemotron 3 Ultra (550B A55B) arrive en tête à 95 %, soit un avantage mesurable mais inscrit dans une plage de scores déjà haute.
La lecture de ces résultats exige toutefois plusieurs précautions. Les scores sont majoritairement auto-déclarés par les éditeurs, ce qui leur confère une rigueur différente de mesures entièrement reproduites de manière indépendante. La proximité avec le plafond de l’accuracy peut aussi réduire le pouvoir discriminant du benchmark entre modèles très performants. Son caractère public appelle à la vigilance quant au risque de contamination. Enfin, sa portée reste celle de tâches synthétiques en anglais, centrées sur le contexte long, et non celle d’une mesure générale de toutes les capacités d’un modèle.
Sources des scores : llm-stats.