Llama 3.1 Nemotron Ultra 253B v1

Publié par NVIDIA le 7 avril 2025, Llama 3.1 Nemotron Ultra 253B v1 est déjà ancien à l’échelle de l’IA. Issu de Llama 3.1 405B Instruct, ce LLM dense de 253 milliards de paramètres a été remanié par recherche d’architecture afin d’intégrer des blocs non standard.

Publié par NVIDIA le 7 avril 2025, Llama 3.1 Nemotron Ultra 253B v1 est déjà ancien à l’échelle de l’IA. Issu de Llama 3.1 405B Instruct, ce LLM dense de 253 milliards de paramètres a été remanié par recherche d’architecture afin d’intégrer des blocs non standard.

Le modèle se distingue par un mode de raisonnement activable dans le prompt système et par une fenêtre de contexte de 131 072 tokens. Il cible notamment le raisonnement, le RAG, l’appel d’outils, les mathématiques, le code et le suivi d’instructions. Sa licence Llama 3.1 Community License ne rend pas ses poids ouverts.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurNVIDIA
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
LicenceLlama 3.1 Community License
Date de sortie7 avril 2025
Connaissances jusqu'à2023-12-01
Multimodalnon
Paramètres253 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MATH-50097,0 %8ᵉ / 31llm-statsAuto-déclaré
IFEval89,5 %21ᵉ / 65llm-statsAuto-déclaré
GPQA76,0 %92ᵉ / 219llm-statsAuto-déclaré
BFCL v274,1 %2ᵉ / 5llm-statsAuto-déclaré
AIME 202572,5 %77ᵉ / 108llm-statsAuto-déclaré
LiveCodeBench66,3 %25ᵉ / 72llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
184ᵉo3-mini1348
185ᵉamazon-nova-experimental-chat-10-091348
186ᵉLlama 3.1 Nemotron Ultra 253B v11347
187ᵉQwen3 32B1347
188ᵉMercury 21347

Notre analyse

Forces. À sa sortie, Llama 3.1 Nemotron Ultra 253B v1 se situait dans le top 12 % des LLM de sa génération sur GPQA, un benchmark centré sur des questions scientifiques difficiles. Ce résultat le plaçait alors dans le haut du panier pour le raisonnement. Son post-entraînement couvre aussi les préférences conversationnelles humaines, le RAG, l’appel d’outils, les mathématiques, le code et le suivi d’instructions. Le mode de raisonnement peut être activé ou désactivé selon le prompt système. Le modèle accepte et génère du texte en anglais, dans plusieurs langues de programmation, ainsi qu’en allemand, français, italien, portugais, hindi, espagnol et thaï. Il fonctionne avec Transformers et vLLM.

Limites et points d’attention. Environ un an représente une ancienneté très importante dans ce secteur. Ses performances sont désormais largement dépassées : son classement Arena text le place près du bas d’un panel de 200 modèles, loin du premier. Les modèles de cette période sont aussi souvent retirés des catalogues des éditeurs. Ses connaissances s’arrêtent au 1er décembre 2023, ce qui limite son intérêt pour les informations récentes. Enfin, ses 253 milliards de paramètres impliquent une architecture particulièrement volumineuse, tandis que ses poids restent non ouverts malgré une licence communautaire.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai).