Llama-3.3 Nemotron Super 49B v1

Sorti le 18 mars 2025, Llama-3.3 Nemotron Super 49B v1 est un LLM de NVIDIA comptant 50 milliards de paramètres. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et doit être comparé aux modèles disponibles lors de son lancement plutôt qu’aux systèmes…

Sorti le 18 mars 2025, Llama-3.3 Nemotron Super 49B v1 est un LLM de NVIDIA comptant 50 milliards de paramètres. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et doit être comparé aux modèles disponibles lors de son lancement plutôt qu’aux systèmes actuels.

Dérivé de Meta Llama-3.3-70B-Instruct, ce Transformer dense decoder-only adopte une architecture personnalisée par Neural Architecture Search, avec skip attention et FFN variables. Il se distingue par un mode de raisonnement activable dans le prompt système, une fenêtre de 131 072 tokens et un post-entraînement couvrant notamment les instructions, le RAG et le tool calling.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurNVIDIA
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
LicenceLlama 3.1 Community License
Date de sortie18 mars 2025
Connaissances jusqu'à2023-12-31
Multimodalnon
Paramètres50 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MATH-50096,6 %11ᵉ / 31llm-statsAuto-déclaré
MT-Bench91,7 %2ᵉ / 12llm-statsAuto-déclaré
MBPP91,3 %2ᵉ / 33llm-statsAuto-déclaré
Arena Hard88,3 %4ᵉ / 26llm-statsAuto-déclaré
BFCL v273,7 %3ᵉ / 5llm-statsAuto-déclaré
GPQA66,7 %130ᵉ / 219llm-statsAuto-déclaré
AIME 202558,4 %92ᵉ / 108llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. À sa sortie, Llama-3.3 Nemotron Super 49B v1 se classait dans le top 22% des 80 LLM de sa génération sur GPQA, un benchmark centré sur des questions scientifiques difficiles. Ce résultat le situait dans le haut du panier de son époque pour le raisonnement évalué par ce test. Son contexte de 131 072 tokens favorise le traitement de textes volumineux. Son post-entraînement associe raisonnement, préférences de chat humain, suivi d’instructions, RAG et tool calling. Le mode de raisonnement peut être activé ou désactivé par le prompt système. Le modèle accepte et produit du texte, avec un positionnement prioritaire sur l’anglais et les langages de code. NVIDIA annonce aussi la prise en charge de l’allemand, du français, de l’italien, du portugais, de l’hindi, de l’espagnol et du thaï.

Limites et points d’attention. Son ancienneté d’environ un an est très importante dans ce secteur. Ses performances sont désormais largement dépassées par les modèles plus récents, et un modèle de cette période peut déjà avoir quitté le catalogue de son éditeur. Ses connaissances s’arrêtent au 31 décembre 2023, ce qui limite sa pertinence sur les événements ultérieurs sans apport externe. Enfin, ses poids ne sont pas ouverts, malgré une diffusion sous Llama 3.1 Community License.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).