Nemotron 3 Super (120B A12B)
Publié par NVIDIA le 11 mars 2026, Nemotron 3 Super (120B A12B) est un LLM à poids ouverts sous licence commerciale. Il réunit 120 milliards de paramètres, dont 12 milliards actifs, dans une architecture hybride LatentMoE associant Mamba-2, MoE, Attention et Multi-Token Prediction.
Publié par NVIDIA le 11 mars 2026, Nemotron 3 Super (120B A12B) est un LLM à poids ouverts sous licence commerciale. Il réunit 120 milliards de paramètres, dont 12 milliards actifs, dans une architecture hybride LatentMoE associant Mamba-2, MoE, Attention et Multi-Token Prediction.
Sa fenêtre de contexte atteint 1 million de tokens et son mode de raisonnement est configurable. Multilingue, notamment en français, il cible les agents collaboratifs, l’usage d’outils, le RAG, le chat, les instructions complexes et les traitements à haut volume. Son accès gratuit le place 100% sous le tarif moyen des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | NVIDIA |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | NVIDIA Open Model License Agreement |
| Date de sortie | 11 mars 2026 |
| Connaissances jusqu'à | 2025-06-01 |
| Multimodal | non |
| Paramètres | 120 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| HMMT 2025 | 94,7 % | 8ᵉ / 33 | llm-stats | Auto-déclaré |
| RULER | 91,8 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| AIME 2025 | 90,2 % | 43ᵉ / 108 | llm-stats | Auto-déclaré |
| WMT24++ | 86,7 % | 1ᵉ / 23 | llm-stats | Auto-déclaré |
| MMLU-Pro | 83,7 % | 28ᵉ / 125 | llm-stats | Auto-déclaré |
| GPQA | 82,7 % | 63ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench | 81,2 % | 7ᵉ / 72 | llm-stats | Auto-déclaré |
| MMLU-ProX | 79,4 % | 12ᵉ / 32 | llm-stats | Auto-déclaré |
| Arena-Hard v2 | 73,9 % | 6ᵉ / 16 | llm-stats | Auto-déclaré |
| IFBench | 72,6 % | 12ᵉ / 27 | llm-stats | Auto-déclaré |
| Tau2 Telecom | 64,4 % | 28ᵉ / 34 | llm-stats | Auto-déclaré |
| Tau2 Retail | 62,8 % | 23ᵉ / 25 | llm-stats | Auto-déclaré |
| AA-LCR | 58,3 % | 12ᵉ / 15 | llm-stats | Auto-déclaré |
| Tau2 Airline | 56,2 % | 17ᵉ / 22 | llm-stats | Auto-déclaré |
| Multi-Challenge | 55,2 % | 12ᵉ / 28 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 53,7 % | 84ᵉ / 102 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 45,8 % | 32ᵉ / 34 | llm-stats | Auto-déclaré |
| SciCode | 42,0 % | 10ᵉ / 18 | llm-stats | Auto-déclaré |
| Bird-SQL (dev) | 41,8 % | 5ᵉ / 7 | llm-stats | Auto-déclaré |
| BrowseComp | 31,3 % | 53ᵉ / 57 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 31,0 % | 49ᵉ / 49 | llm-stats | Auto-déclaré |
| Terminal-Bench | 25,8 % | 22ᵉ / 25 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 22,8 % | 51ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 168ᵉ | o3-mini | 1363 |
| 169ᵉ | Grok-3 Mini | 1362 |
| 170ᵉ | Nemotron 3 Super (120B A12B) | 1362 |
| 171ᵉ | gemini-2.0-flash-001 | 1360 |
| 172ᵉ | DeepSeek-V3 | 1358 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| NVIDIA | gratuit | gratuit | n.d. |
| DekaLLM | 0,08 $ | 0,45 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 0 $ |
| Durée d'exécution — PinchBench | 6 h 02 min |
| Coût moyen par benchmark — Benchable | 0,05 $ |
| Latence moyenne par benchmark — Benchable | 5 min 24 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, Nemotron 3 Super figurait dans le top 24% des LLM de sa génération sur GPQA, ce qui le situait favorablement sur les questions scientifiques difficiles. Le raisonnement constitue son résultat Benchable le plus compétitif en classement relatif, devant ses performances en mathématiques et en connaissances générales. Le score Ethics est très élevé, même si son rang reste proche du milieu du tableau. La fenêtre de 1 million de tokens convient au raisonnement sur de longs contextes, au RAG et au traitement de corpus volumineux. L’activation de 12 milliards de paramètres sur 120 milliards totaux soutient son positionnement pour les charges importantes.
Limites et points d'attention. Les classements Benchable sont moins favorables en classification d’e-mails et en connaissances générales, où le modèle se situe près du bas des panels évalués. Les résultats sur les hallucinations et les mathématiques restent également en retrait relatif. Dans Arena text, son rang le place loin des modèles haut de gamme malgré un Elo de 1361. Ses connaissances s’arrêtent au 1er juin 2025. Son principal intérêt concerne donc les agents, le RAG, le long contexte et les volumes élevés lorsque le coût minimal, gratuit, prime sur les meilleurs classements comparatifs.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).