nova-2-lite-v1

nova-2-lite-v1 est un LLM propriétaire d’Amazon, sorti le 2 décembre 2025. Son profil Benchable présente des scores bruts élevés sur plusieurs tests, mais les classements relatifs donnent une image plus nuancée de ses performances.

nova-2-lite-v1 est un LLM propriétaire d’Amazon, sorti le 2 décembre 2025. Son profil Benchable présente des scores bruts élevés sur plusieurs tests, mais les classements relatifs donnent une image plus nuancée de ses performances.

Le modèle atteint notamment le plafond sur Ethics. Ce résultat est toutefois partagé par de nombreux concurrents et distingue peu les modèles évalués. Coding constitue son résultat relatif le plus solide, tandis que Mathematics et surtout Instruction Following révèlent un positionnement plus en retrait.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAmazon
Poids🔒 Propriétaire
Date de sortie2 décembre 2025

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)97,5 %97ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)97,0 %100ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)88,0 %83ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)83,0 %98ᵉ / 140benchable✅ Mesuré
Benchable : Instruction Following (Baseline)48,0 %115ᵉ / 163benchable✅ Mesuré
Benchable : Hallucinations (Baseline)46,0 %136ᵉ / 146benchable✅ Mesuré
Benchable : Reasoning (Baseline)42,0 %131ᵉ / 155benchable✅ Mesuré
PinchBench : agentique (OpenClaw, 147 tâches)37,6 %19ᵉ / 19pinchbench✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

▶ nova-2-lite-v1100 %
command-r-plus-08-202499 %

Benchable : General Knowledge (Baseline)

skyfall-36b-v298 %
▶ nova-2-lite-v198 %

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)4,67 $
Durée d'exécution — PinchBench2 h 53 min
Indice valeur/coût — PinchBench70,39
Coût moyen par benchmark — Benchable0 $
Latence moyenne par benchmark — Benchable2 min 50 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. nova-2-lite-v1 obtient 100% sur Ethics et partage la première place avec 71 autres modèles. Ce benchmark plafonné confirme la réussite du test sans établir de supériorité nette. Coding fournit un signal plus discriminant : avec 88%, le modèle se situe près du milieu du classement. Les scores bruts restent également élevés sur General Knowledge et Email Classification, même si leur pouvoir de comparaison est limité par le plafonnement de ces évaluations.

Limites et points d’attention. Les rangs relativisent fortement les pourcentages affichés. Sur General Knowledge, nova-2-lite-v1 partage la 97e place sur 161. Sur Email Classification, il partage la 100e place sur 163 avec 21 autres modèles. Mathematics le place dans la partie basse du classement, au 98e rang sur 140. Instruction Following constitue sa faiblesse la plus marquée : son score tombe à 48% et le modèle partage la 115e place sur 163. D’après ces résultats Benchable, il convient davantage aux tâches proches de Coding qu’aux usages exigeant un suivi rigoureux des consignes.


Sources des données : LLM-Stats (llm-stats.com) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).