Llama 3.1 Nemotron Ultra 253B v1
Publié par NVIDIA le 7 avril 2025, Llama 3.1 Nemotron Ultra 253B v1 est déjà ancien à l’échelle de l’IA. Issu de Llama 3.1 405B Instruct, ce LLM dense de 253 milliards de paramètres a été remanié par recherche d’architecture afin d’intégrer des blocs non standard.
Publié par NVIDIA le 7 avril 2025, Llama 3.1 Nemotron Ultra 253B v1 est déjà ancien à l’échelle de l’IA. Issu de Llama 3.1 405B Instruct, ce LLM dense de 253 milliards de paramètres a été remanié par recherche d’architecture afin d’intégrer des blocs non standard.
Le modèle se distingue par un mode de raisonnement activable dans le prompt système et par une fenêtre de contexte de 131 072 tokens. Il cible notamment le raisonnement, le RAG, l’appel d’outils, les mathématiques, le code et le suivi d’instructions. Sa licence Llama 3.1 Community License ne rend pas ses poids ouverts.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | NVIDIA |
| Poids | 🟢 Poids ouverts · usage commercial restreint (recherche / non commercial) |
| Licence | Llama 3.1 Community License |
| Date de sortie | 7 avril 2025 |
| Connaissances jusqu'à | 2023-12-01 |
| Multimodal | non |
| Paramètres | 253 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MATH-500 | 97,0 % | 8ᵉ / 31 | llm-stats | Auto-déclaré |
| IFEval | 89,5 % | 21ᵉ / 65 | llm-stats | Auto-déclaré |
| GPQA | 76,0 % | 92ᵉ / 219 | llm-stats | Auto-déclaré |
| BFCL v2 | 74,1 % | 2ᵉ / 5 | llm-stats | Auto-déclaré |
| AIME 2025 | 72,5 % | 77ᵉ / 108 | llm-stats | Auto-déclaré |
| LiveCodeBench | 66,3 % | 25ᵉ / 72 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 184ᵉ | o3-mini | 1348 |
| 185ᵉ | amazon-nova-experimental-chat-10-09 | 1348 |
| 186ᵉ | Llama 3.1 Nemotron Ultra 253B v1 | 1347 |
| 187ᵉ | Qwen3 32B | 1347 |
| 188ᵉ | Mercury 2 | 1347 |
Notre analyse
Forces. À sa sortie, Llama 3.1 Nemotron Ultra 253B v1 se situait dans le top 12 % des LLM de sa génération sur GPQA, un benchmark centré sur des questions scientifiques difficiles. Ce résultat le plaçait alors dans le haut du panier pour le raisonnement. Son post-entraînement couvre aussi les préférences conversationnelles humaines, le RAG, l’appel d’outils, les mathématiques, le code et le suivi d’instructions. Le mode de raisonnement peut être activé ou désactivé selon le prompt système. Le modèle accepte et génère du texte en anglais, dans plusieurs langues de programmation, ainsi qu’en allemand, français, italien, portugais, hindi, espagnol et thaï. Il fonctionne avec Transformers et vLLM.
Limites et points d’attention. Environ un an représente une ancienneté très importante dans ce secteur. Ses performances sont désormais largement dépassées : son classement Arena text le place près du bas d’un panel de 200 modèles, loin du premier. Les modèles de cette période sont aussi souvent retirés des catalogues des éditeurs. Ses connaissances s’arrêtent au 1er décembre 2023, ce qui limite son intérêt pour les informations récentes. Enfin, ses 253 milliards de paramètres impliquent une architecture particulièrement volumineuse, tandis que ses poids restent non ouverts malgré une licence communautaire.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai).