Nemotron 3 Ultra (550B A55B)

Nemotron 3 Ultra (550B A55B) est un LLM open-weights de NVIDIA, sorti le 4 juin 2026 sous licence OpenMDW v1.1, avec usage commercial autorisé. Ses 550 milliards de paramètres, dont 55 milliards actifs, reposent sur une architecture hybride Mamba2-Transformer LatentMoE avec Multi-Token…

Nemotron 3 Ultra (550B A55B) est un LLM open-weights de NVIDIA, sorti le 4 juin 2026 sous licence OpenMDW v1.1, avec usage commercial autorisé. Ses 550 milliards de paramètres, dont 55 milliards actifs, reposent sur une architecture hybride Mamba2-Transformer LatentMoE avec Multi-Token Prediction.

Le modèle se distingue par une fenêtre de contexte de 1 million de tokens et un mode de raisonnement configurable. Il couvre notamment le chat, les workflows agentiques, l’analyse de longs contextes, l’utilisation d’outils, le RAG et le raisonnement sur le code, les mathématiques et les sciences. Son offre minimale gratuite le place dans un positionnement très économique.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurNVIDIA
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceOpenMDW License v1.1
Date de sortie4 juin 2026
Connaissances jusqu'à2025-09-30
Multimodalnon
Paramètres550 milliards
Fenêtre de contexte1 000 000 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
RULER94,7 %1ᵉ / 4llm-statsAuto-déclaré
IMO-AnswerBench92,3 %1ᵉ / 19llm-statsAuto-déclaré
PinchBench90,0 %1ᵉ / 4llm-statsAuto-déclaré
LiveCodeBench v689,0 %4ᵉ / 53llm-statsAuto-déclaré
GPQA87,0 %35ᵉ / 219llm-statsAuto-déclaré
MMLU-Pro86,8 %9ᵉ / 125llm-statsAuto-déclaré
WMT24++83,7 %6ᵉ / 23llm-statsAuto-déclaré
MMLU-ProX83,0 %5ᵉ / 32llm-statsAuto-déclaré
IFBench81,7 %1ᵉ / 27llm-statsAuto-déclaré
SWE-Bench Verified70,7 %55ᵉ / 102llm-statsAuto-déclaré
SWE-bench Multilingual67,7 %21ᵉ / 34llm-statsAuto-déclaré
AA-LCR65,4 %8ᵉ / 15llm-statsAuto-déclaré
Multi-Challenge63,8 %6ᵉ / 28llm-statsAuto-déclaré
LongBench v261,9 %3ᵉ / 15llm-statsAuto-déclaré
Terminal-Bench 2.156,4 %13ᵉ / 13llm-statsAuto-déclaré
Finance Agent53,7 %8ᵉ / 8llm-statsAuto-déclaré
GDPval46,7 %3ᵉ / 3llm-statsAuto-déclaré
SciCode44,6 %9ᵉ / 18llm-statsAuto-déclaré
BrowseComp44,4 %48ᵉ / 57llm-statsAuto-déclaré
GDPval-AA39,4 %24ᵉ / 39llm-statsn.d.
Finance Agent v237,5 %20ᵉ / 26llm-statsn.d.
Humanity's Last Exam37,4 %35ᵉ / 89llm-statsAuto-déclaré
TAU3-Bench22,6 %5ᵉ / 5llm-statsAuto-déclaré
CritPT3,1 %4ᵉ / 4llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
91ᵉClaude Opus 41424
92ᵉQwen3 Max1424
93ᵉNemotron 3 Ultra (550B A55B)1424
94ᵉQwen3-235B-A22B-Instruct-25071423
95ᵉDeepSeek-V3.2 (Thinking)1423

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
NVIDIAgratuitgratuitn.d.
DeepInfra0,5 $2,2 $0,1 $

Prix en dollars US par million de tokens.

Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)0 $
Durée d'exécution — PinchBench2 h 30 min
Coût moyen par benchmark — Benchable0,05 $
Latence moyenne par benchmark — Benchable25 min 19 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Nemotron 3 Ultra atteint la première place sur les tests Benchable d’Instruction Following et d’Email Classification. Il se classe aussi troisième sur PinchBench avec OpenClaw, qui évalue l’exécution de 147 tâches agentiques, ce qui confirme son intérêt pour les workflows complexes et l’utilisation d’outils. À sa sortie, il figurait dans le top 17% des LLM de sa génération sur GPQA. Sa fenêtre de 1 million de tokens favorise l’analyse de corpus longs, tandis que son mode de raisonnement peut être activé ou désactivé selon l’usage. La tarification minimale est gratuite et se situe 100% sous la moyenne des LLM similaires.

Limites et points d’attention. Les résultats sont nettement moins convaincants en raisonnement général et en connaissances générales, avec des classements proches du bas des panels Benchable. Le score élevé au test Hallucinations ne correspond pas à une place de premier plan, le modèle restant en seconde moitié de classement. Dans l’Arena text, son Elo le situe également derrière les modèles de tête. Ses connaissances s’arrêtent au 30 septembre 2025. Il convient surtout aux tâches agentiques, au suivi d’instructions, à la classification d’e-mails et au traitement de très longs contextes, plutôt qu’aux demandes centrées sur la culture générale ou le raisonnement généraliste.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).