Nemotron 3 Super (120B A12B)

Publié par NVIDIA le 11 mars 2026, Nemotron 3 Super (120B A12B) est un LLM à poids ouverts sous licence commerciale. Il réunit 120 milliards de paramètres, dont 12 milliards actifs, dans une architecture hybride LatentMoE associant Mamba-2, MoE, Attention et Multi-Token Prediction.

Publié par NVIDIA le 11 mars 2026, Nemotron 3 Super (120B A12B) est un LLM à poids ouverts sous licence commerciale. Il réunit 120 milliards de paramètres, dont 12 milliards actifs, dans une architecture hybride LatentMoE associant Mamba-2, MoE, Attention et Multi-Token Prediction.

Sa fenêtre de contexte atteint 1 million de tokens et son mode de raisonnement est configurable. Multilingue, notamment en français, il cible les agents collaboratifs, l’usage d’outils, le RAG, le chat, les instructions complexes et les traitements à haut volume. Son accès gratuit le place 100% sous le tarif moyen des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurNVIDIA
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceNVIDIA Open Model License Agreement
Date de sortie11 mars 2026
Connaissances jusqu'à2025-06-01
Multimodalnon
Paramètres120 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
HMMT 202594,7 %8ᵉ / 33llm-statsAuto-déclaré
RULER91,8 %2ᵉ / 4llm-statsAuto-déclaré
AIME 202590,2 %43ᵉ / 108llm-statsAuto-déclaré
WMT24++86,7 %1ᵉ / 23llm-statsAuto-déclaré
MMLU-Pro83,7 %28ᵉ / 125llm-statsAuto-déclaré
GPQA82,7 %63ᵉ / 219llm-statsAuto-déclaré
LiveCodeBench81,2 %7ᵉ / 72llm-statsAuto-déclaré
MMLU-ProX79,4 %12ᵉ / 32llm-statsAuto-déclaré
Arena-Hard v273,9 %6ᵉ / 16llm-statsAuto-déclaré
IFBench72,6 %12ᵉ / 27llm-statsAuto-déclaré
Tau2 Telecom64,4 %28ᵉ / 34llm-statsAuto-déclaré
Tau2 Retail62,8 %23ᵉ / 25llm-statsAuto-déclaré
AA-LCR58,3 %12ᵉ / 15llm-statsAuto-déclaré
Tau2 Airline56,2 %17ᵉ / 22llm-statsAuto-déclaré
Multi-Challenge55,2 %12ᵉ / 28llm-statsAuto-déclaré
SWE-Bench Verified53,7 %84ᵉ / 102llm-statsAuto-déclaré
SWE-bench Multilingual45,8 %32ᵉ / 34llm-statsAuto-déclaré
SciCode42,0 %10ᵉ / 18llm-statsAuto-déclaré
Bird-SQL (dev)41,8 %5ᵉ / 7llm-statsAuto-déclaré
BrowseComp31,3 %53ᵉ / 57llm-statsAuto-déclaré
Terminal-Bench 2.031,0 %49ᵉ / 49llm-statsAuto-déclaré
Terminal-Bench25,8 %22ᵉ / 25llm-statsAuto-déclaré
Humanity's Last Exam22,8 %51ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
168ᵉo3-mini1363
169ᵉGrok-3 Mini1362
170ᵉNemotron 3 Super (120B A12B)1362
171ᵉgemini-2.0-flash-0011360
172ᵉDeepSeek-V31358

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
NVIDIAgratuitgratuitn.d.
DekaLLM0,08 $0,45 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)0 $
Durée d'exécution — PinchBench6 h 02 min
Coût moyen par benchmark — Benchable0,05 $
Latence moyenne par benchmark — Benchable5 min 24 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, Nemotron 3 Super figurait dans le top 24% des LLM de sa génération sur GPQA, ce qui le situait favorablement sur les questions scientifiques difficiles. Le raisonnement constitue son résultat Benchable le plus compétitif en classement relatif, devant ses performances en mathématiques et en connaissances générales. Le score Ethics est très élevé, même si son rang reste proche du milieu du tableau. La fenêtre de 1 million de tokens convient au raisonnement sur de longs contextes, au RAG et au traitement de corpus volumineux. L’activation de 12 milliards de paramètres sur 120 milliards totaux soutient son positionnement pour les charges importantes.

Limites et points d'attention. Les classements Benchable sont moins favorables en classification d’e-mails et en connaissances générales, où le modèle se situe près du bas des panels évalués. Les résultats sur les hallucinations et les mathématiques restent également en retrait relatif. Dans Arena text, son rang le place loin des modèles haut de gamme malgré un Elo de 1361. Ses connaissances s’arrêtent au 1er juin 2025. Son principal intérêt concerne donc les agents, le RAG, le long contexte et les volumes élevés lorsque le coût minimal, gratuit, prime sur les meilleurs classements comparatifs.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).