nemotron-nano-12b-v2-vl
Publié par NVIDIA le 28 octobre 2025 avec des poids ouverts, nemotron-nano-12b-v2-vl est un LLM multimodal de type Transformer. Il associe l’encodeur visuel CRadioV2-H à NVIDIA-Nemotron-Nano-12B-v2. Il traite du texte, jusqu’à quatre images ou des vidéos, puis génère du texte dans une…
Publié par NVIDIA le 28 octobre 2025 avec des poids ouverts, nemotron-nano-12b-v2-vl est un LLM multimodal de type Transformer. Il associe l’encodeur visuel CRadioV2-H à NVIDIA-Nemotron-Nano-12B-v2. Il traite du texte, jusqu’à quatre images ou des vidéos, puis génère du texte dans une fenêtre cumulée de 128 000 tokens.
Le modèle cible l’intelligence documentaire, le raisonnement multi-image, la compréhension vidéo, le résumé et les questions-réponses visuelles, uniquement en anglais. Son inférence est prévue avec Transformers, vLLM, TRT-LLM et SGLang, en BF16, FP8 ou FP4. Son tarif minimal est gratuit, soit 100 % sous la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | NVIDIA |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 28 octobre 2025 |
| Multimodal | oui |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | image,text,video → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 94,0 % | 42ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 80,0 % | 108ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 65,6 % | 136ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 52,6 % | 122ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 0,0 % | 145ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Ethics (Baseline)
Benchable : General Knowledge (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| NVIDIA | gratuit | gratuit | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,06 $ |
| Latence moyenne par benchmark — Benchable | 27 min 42 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. nemotron-nano-12b-v2-vl combine traitement visuel et génération de texte dans une fenêtre de contexte étendue. Son résultat en Reasoning le place dans le premier tiers du classement Benchable, à égalité avec cinq autres modèles. Les tests Ethics, General Knowledge et Email Classification affichent des scores très élevés. Ils sont toutefois plafonnés et largement partagés, ce qui limite leur pouvoir de différenciation. Les poids ouverts, les différents formats numériques et la compatibilité avec quatre moteurs d’inférence offrent plusieurs options de déploiement. Le positionnement tarifaire est particulièrement favorable, avec un tarif minimal gratuit et un coût situé 100 % sous la moyenne des LLM similaires.
Limites et points d'attention. Le modèle est nettement en retrait en Coding, au 136e rang sur 162. Son classement sur Hallucinations reste également faible, au 108e rang sur 146, malgré un score de 80 %. La prise en charge de l’anglais uniquement restreint les usages multilingues. L’entrée visuelle est limitée à quatre images, tandis que les vidéos constituent l’autre format visuel accepté. Le modèle convient surtout aux expérimentations multimodales économiques en anglais, notamment pour l’analyse documentaire, le résumé, la vidéo et les questions-réponses visuelles.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).