Nemotron 3 Ultra (550B A55B)
Nemotron 3 Ultra (550B A55B) est un LLM open-weights de NVIDIA, sorti le 4 juin 2026 sous licence OpenMDW v1.1, avec usage commercial autorisé. Ses 550 milliards de paramètres, dont 55 milliards actifs, reposent sur une architecture hybride Mamba2-Transformer LatentMoE avec Multi-Token…
Nemotron 3 Ultra (550B A55B) est un LLM open-weights de NVIDIA, sorti le 4 juin 2026 sous licence OpenMDW v1.1, avec usage commercial autorisé. Ses 550 milliards de paramètres, dont 55 milliards actifs, reposent sur une architecture hybride Mamba2-Transformer LatentMoE avec Multi-Token Prediction.
Le modèle se distingue par une fenêtre de contexte de 1 million de tokens et un mode de raisonnement configurable. Il couvre notamment le chat, les workflows agentiques, l’analyse de longs contextes, l’utilisation d’outils, le RAG et le raisonnement sur le code, les mathématiques et les sciences. Son offre minimale gratuite le place dans un positionnement très économique.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | NVIDIA |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | OpenMDW License v1.1 |
| Date de sortie | 4 juin 2026 |
| Connaissances jusqu'à | 2025-09-30 |
| Multimodal | non |
| Paramètres | 550 milliards |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| RULER | 94,7 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| IMO-AnswerBench | 92,3 % | 1ᵉ / 19 | llm-stats | Auto-déclaré |
| PinchBench | 90,0 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 89,0 % | 4ᵉ / 53 | llm-stats | Auto-déclaré |
| GPQA | 87,0 % | 35ᵉ / 219 | llm-stats | Auto-déclaré |
| MMLU-Pro | 86,8 % | 9ᵉ / 125 | llm-stats | Auto-déclaré |
| WMT24++ | 83,7 % | 6ᵉ / 23 | llm-stats | Auto-déclaré |
| MMLU-ProX | 83,0 % | 5ᵉ / 32 | llm-stats | Auto-déclaré |
| IFBench | 81,7 % | 1ᵉ / 27 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 70,7 % | 55ᵉ / 102 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 67,7 % | 21ᵉ / 34 | llm-stats | Auto-déclaré |
| AA-LCR | 65,4 % | 8ᵉ / 15 | llm-stats | Auto-déclaré |
| Multi-Challenge | 63,8 % | 6ᵉ / 28 | llm-stats | Auto-déclaré |
| LongBench v2 | 61,9 % | 3ᵉ / 15 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.1 | 56,4 % | 13ᵉ / 13 | llm-stats | Auto-déclaré |
| Finance Agent | 53,7 % | 8ᵉ / 8 | llm-stats | Auto-déclaré |
| GDPval | 46,7 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| SciCode | 44,6 % | 9ᵉ / 18 | llm-stats | Auto-déclaré |
| BrowseComp | 44,4 % | 48ᵉ / 57 | llm-stats | Auto-déclaré |
| GDPval-AA | 39,4 % | 24ᵉ / 39 | llm-stats | n.d. |
| Finance Agent v2 | 37,5 % | 20ᵉ / 26 | llm-stats | n.d. |
| Humanity's Last Exam | 37,4 % | 35ᵉ / 89 | llm-stats | Auto-déclaré |
| TAU3-Bench | 22,6 % | 5ᵉ / 5 | llm-stats | Auto-déclaré |
| CritPT | 3,1 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 91ᵉ | Claude Opus 4 | 1424 |
| 92ᵉ | Qwen3 Max | 1424 |
| 93ᵉ | Nemotron 3 Ultra (550B A55B) | 1424 |
| 94ᵉ | Qwen3-235B-A22B-Instruct-2507 | 1423 |
| 95ᵉ | DeepSeek-V3.2 (Thinking) | 1423 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| NVIDIA | gratuit | gratuit | n.d. |
| DeepInfra | 0,5 $ | 2,2 $ | 0,1 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 0 $ |
| Durée d'exécution — PinchBench | 2 h 30 min |
| Coût moyen par benchmark — Benchable | 0,05 $ |
| Latence moyenne par benchmark — Benchable | 25 min 19 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Nemotron 3 Ultra atteint la première place sur les tests Benchable d’Instruction Following et d’Email Classification. Il se classe aussi troisième sur PinchBench avec OpenClaw, qui évalue l’exécution de 147 tâches agentiques, ce qui confirme son intérêt pour les workflows complexes et l’utilisation d’outils. À sa sortie, il figurait dans le top 17% des LLM de sa génération sur GPQA. Sa fenêtre de 1 million de tokens favorise l’analyse de corpus longs, tandis que son mode de raisonnement peut être activé ou désactivé selon l’usage. La tarification minimale est gratuite et se situe 100% sous la moyenne des LLM similaires.
Limites et points d’attention. Les résultats sont nettement moins convaincants en raisonnement général et en connaissances générales, avec des classements proches du bas des panels Benchable. Le score élevé au test Hallucinations ne correspond pas à une place de premier plan, le modèle restant en seconde moitié de classement. Dans l’Arena text, son Elo le situe également derrière les modèles de tête. Ses connaissances s’arrêtent au 30 septembre 2025. Il convient surtout aux tâches agentiques, au suivi d’instructions, à la classification d’e-mails et au traitement de très longs contextes, plutôt qu’aux demandes centrées sur la culture générale ou le raisonnement généraliste.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).