nova-premier-v1

nova-premier-v1 est un LLM propriétaire d’Amazon. Son profil Benchable est très contrasté, avec des résultats élevés sur Hallucinations et Email Classification, mais des performances nettement plus faibles dans plusieurs autres catégories.

nova-premier-v1 est un LLM propriétaire d’Amazon. Son profil Benchable est très contrasté, avec des résultats élevés sur Hallucinations et Email Classification, mais des performances nettement plus faibles dans plusieurs autres catégories.

Les scores les plus flatteurs proviennent de benchmarks plafonnés et peu discriminants. Les classements en Reasoning, Mathematics, Coding et Instruction Following donnent une image moins favorable de ses capacités générales.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAmazon
Poids🔒 Propriétaire

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)68,0 %94ᵉ / 155benchable✅ Mesuré
Benchable : Mathematics (Baseline)48,0 %123ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)43,0 %143ᵉ / 162benchable✅ Mesuré
Benchable : Instruction Following (Baseline)3,0 %144ᵉ / 163benchable✅ Mesuré
Benchable : General Knowledge (Baseline)0,0 %153ᵉ / 161benchable✅ Mesuré
Benchable : Ethics (Baseline)0,0 %152ᵉ / 159benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ nova-premier-v1100 %

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
▶ nova-premier-v199 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,2 $
Latence moyenne par benchmark — Benchable8 min 53 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Sur Hallucinations, nova-premier-v1 obtient 100% et partage la première place avec 45 autres modèles. Sur Email Classification, il atteint 99% et partage la 11e place avec 40 autres modèles. Ces résultats montrent une bonne réussite aux tests concernés, mais les nombreux ex æquo et le plafonnement des benchmarks ne permettent pas d’établir un avantage sur les autres modèles.

Limites et points d’attention. Le modèle se situe dans la moitié basse en Reasoning, à la 94e place sur 155. Il recule davantage en Mathematics, au rang 123 sur 140, puis en Coding, au rang 143 sur 162. Instruction Following constitue sa faiblesse la plus marquée : son score de 3% le place 144e sur 163. Ce résultat limite fortement son intérêt pour les tâches qui exigent le respect précis de consignes, tandis que ses classements en mathématiques et en code signalent un positionnement peu compétitif dans ces domaines.


Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).