nova-2-lite-v1
nova-2-lite-v1 est un LLM propriétaire d’Amazon, sorti le 2 décembre 2025. Son profil Benchable présente des scores bruts élevés sur plusieurs tests, mais les classements relatifs donnent une image plus nuancée de ses performances.
nova-2-lite-v1 est un LLM propriétaire d’Amazon, sorti le 2 décembre 2025. Son profil Benchable présente des scores bruts élevés sur plusieurs tests, mais les classements relatifs donnent une image plus nuancée de ses performances.
Le modèle atteint notamment le plafond sur Ethics. Ce résultat est toutefois partagé par de nombreux concurrents et distingue peu les modèles évalués. Coding constitue son résultat relatif le plus solide, tandis que Mathematics et surtout Instruction Following révèlent un positionnement plus en retrait.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Amazon |
| Poids | 🔒 Propriétaire |
| Date de sortie | 2 décembre 2025 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 97,5 % | 97ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 97,0 % | 100ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 88,0 % | 83ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 83,0 % | 98ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 48,0 % | 115ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 46,0 % | 136ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 42,0 % | 131ᵉ / 155 | benchable | ✅ Mesuré |
| PinchBench : agentique (OpenClaw, 147 tâches) | 37,6 % | 19ᵉ / 19 | pinchbench | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Ethics (Baseline)
Benchable : General Knowledge (Baseline)
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 4,67 $ |
| Durée d'exécution — PinchBench | 2 h 53 min |
| Indice valeur/coût — PinchBench | 70,39 |
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 2 min 50 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. nova-2-lite-v1 obtient 100% sur Ethics et partage la première place avec 71 autres modèles. Ce benchmark plafonné confirme la réussite du test sans établir de supériorité nette. Coding fournit un signal plus discriminant : avec 88%, le modèle se situe près du milieu du classement. Les scores bruts restent également élevés sur General Knowledge et Email Classification, même si leur pouvoir de comparaison est limité par le plafonnement de ces évaluations.
Limites et points d’attention. Les rangs relativisent fortement les pourcentages affichés. Sur General Knowledge, nova-2-lite-v1 partage la 97e place sur 161. Sur Email Classification, il partage la 100e place sur 163 avec 21 autres modèles. Mathematics le place dans la partie basse du classement, au 98e rang sur 140. Instruction Following constitue sa faiblesse la plus marquée : son score tombe à 48% et le modèle partage la 115e place sur 163. D’après ces résultats Benchable, il convient davantage aux tâches proches de Coding qu’aux usages exigeant un suivi rigoureux des consignes.
Sources des données : LLM-Stats (llm-stats.com) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).