RULER

RULER est un benchmark synthétique conçu par NVIDIA pour évaluer les modèles confrontés à de très longs contextes. Ses tâches en anglais couvrent la récupération d’information, le suivi multi-sauts, l’agrégation et la question-réponse, avec des réponses courtes ou structurées.

RULER est un benchmark synthétique conçu par NVIDIA pour évaluer les modèles confrontés à de très longs contextes. Ses tâches en anglais couvrent la récupération d’information, le suivi multi-sauts, l’agrégation et la question-réponse, avec des réponses courtes ou structurées.

Son objectif est d’observer comment la qualité d’un modèle évolue lorsque la longueur d’entrée augmente. RULER complète ainsi l’évaluation des capacités en contexte long en mesurant non seulement la réussite aux tâches, mais aussi la dégradation progressive des performances.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkNVIDIA
Capacités mesuréescontexte long, raisonnement
ModalitéTexte
Type de questionstâches synthétiques de contexte long avec réponses courtes ou structurées
Métrique d'évaluationaccuracy
AccèsPublic
LicenceApache-2.0
Languesanglais
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (4)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert94,7 %4 juin 2026Auto-déclaré
2Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert91,8 %11 mars 2026Auto-déclaré
3Phi-3.5-MoE-instructMicrosoft🟢 Ouvert87,1 %23 août 2024Auto-déclaré
4Phi-3.5-mini-instructMicrosoft🟢 Ouvert84,1 %23 août 2024Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 89,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle restitue avec précision les réponses attendues dans les tâches synthétiques de RULER et exploite efficacement les informations présentes dans de longs contextes. Il traduit aussi une meilleure résistance à l’allongement des entrées sur les dimensions évaluées. Le classement montre un niveau globalement élevé parmi les quatre modèles recensés, avec une médiane de 89 %. Nemotron 3 Ultra (550B A55B) arrive en tête à 95 %, soit un avantage mesurable mais inscrit dans une plage de scores déjà haute.

La lecture de ces résultats exige toutefois plusieurs précautions. Les scores sont majoritairement auto-déclarés par les éditeurs, ce qui leur confère une rigueur différente de mesures entièrement reproduites de manière indépendante. La proximité avec le plafond de l’accuracy peut aussi réduire le pouvoir discriminant du benchmark entre modèles très performants. Son caractère public appelle à la vigilance quant au risque de contamination. Enfin, sa portée reste celle de tâches synthétiques en anglais, centrées sur le contexte long, et non celle d’une mesure générale de toutes les capacités d’un modèle.


Sources des scores : llm-stats.