Nemotron 3 Nano (30B A3B)

Nemotron 3 Nano (30B A3B) est un LLM open-weights de NVIDIA, sorti le 15 décembre 2025. Ce modèle de base de 32 milliards de paramètres associe Mamba2, Transformer et Mixture of Experts. Il traite et produit du texte dans une vingtaine de langues, dont le français.

Nemotron 3 Nano (30B A3B) est un LLM open-weights de NVIDIA, sorti le 15 décembre 2025. Ce modèle de base de 32 milliards de paramètres associe Mamba2, Transformer et Mixture of Experts. Il traite et produit du texte dans une vingtaine de langues, dont le français.

Destiné au fine-tuning d’instructions, il combine une fenêtre de contexte de 262 144 tokens et un positionnement très économique, avec un tarif minimal gratuit en entrée comme en sortie. Son entraînement représente 4,8 × 10²³ FLOP, soit environ 133 000 heures-GPU H100.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurNVIDIA
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceNVIDIA Open Model License Agreement
Date de sortie15 décembre 2025
Connaissances jusqu'à2025-11-28
Multimodalnon
Paramètres32 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202599,2 %9ᵉ / 108llm-statsAuto-déclaré
WMT24++86,2 %2ᵉ / 23llm-statsAuto-déclaré
MMLU-Pro78,3 %56ᵉ / 125llm-statsAuto-déclaré
GPQA75,0 %98ᵉ / 219llm-statsAuto-déclaré
LiveCodeBench v668,3 %34ᵉ / 53llm-statsAuto-déclaré
Arena-Hard v267,7 %8ᵉ / 16llm-statsAuto-déclaré
MMLU-ProX59,5 %25ᵉ / 32llm-statsAuto-déclaré
Tau2 Retail56,9 %25ᵉ / 25llm-statsAuto-déclaré
Tau2 Airline48,0 %19ᵉ / 22llm-statsAuto-déclaré
Tau2 Telecom42,2 %32ᵉ / 34llm-statsAuto-déclaré
SWE-Bench Verified38,8 %94ᵉ / 102llm-statsAuto-déclaré
Multi-Challenge38,5 %23ᵉ / 28llm-statsAuto-déclaré
SciCode33,3 %18ᵉ / 18llm-statsAuto-déclaré
Humanity's Last Exam15,5 %67ᵉ / 89llm-statsAuto-déclaré
Terminal-Bench8,5 %24ᵉ / 25llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
NVIDIAgratuitgratuitn.d.
DeepInfra0,05 $0,2 $n.d.
deepinfra0,06 $0,24 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,02 $
Latence moyenne par benchmark — Benchable9 min 13 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement4,8 × 10²³ FLOP
MatérielNVIDIA H100 SXM5 80GB
PaysUnited States of America

Notre analyse

Forces. Nemotron 3 Nano (30B A3B) se distingue surtout en programmation, où son résultat le place dans le premier cinquième des modèles évalués par Benchable. À sa sortie, il figurait également dans le top 34% des LLM de sa génération sur GPQA, ce qui situe correctement ses capacités de raisonnement scientifique pour son époque. Son architecture Nemotron Hybrid MoE et son contexte étendu en font une base adaptée aux longues séquences et à la spécialisation par fine-tuning. Sa licence autorise l’usage commercial, tandis que ses tarifs minimaux sont 100% sous la moyenne des LLM similaires.

Limites et points d'attention. Les scores bruts élevés en Ethics et General Knowledge ne se traduisent pas par des positions dominantes face aux autres modèles évalués. Ethics reste proche du milieu du classement, tandis que General Knowledge se situe dans sa partie basse. Il s’agit par ailleurs d’un modèle de base entraîné à prédire le token suivant, conçu comme point de départ pour un fine-tuning d’instructions plutôt que comme assistant final. La configuration de contexte recensée atteint 262 144 tokens, malgré un support technique annoncé jusqu’à 1M selon la configuration. Le modèle convient surtout aux projets de spécialisation multilingue, de programmation et de traitement de longs textes à coût minimal.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).