Nous: Hermes 4 405B

Nous: Hermes 4 405B est un LLM à poids ouverts publié par Nous Research le 26 août 2025. Fondé sur Llama-3.1-405B, ce modèle de raisonnement hybride propose une fenêtre de contexte de 131 072 tokens et des connaissances arrêtées au 31 août 2024.

Nous: Hermes 4 405B est un LLM à poids ouverts publié par Nous Research le 26 août 2025. Fondé sur Llama-3.1-405B, ce modèle de raisonnement hybride propose une fenêtre de contexte de 131 072 tokens et des connaissances arrêtées au 31 août 2024.

Son post-entraînement privilégie les raisonnements vérifiés, les mathématiques, le code, les STEM, la logique, la créativité et le respect des formats. Il gère le raisonnement explicite, les appels d’outils et la production ou la réparation de JSON. Son tarif est très économique, 52% sous la moyenne des LLM similaires et environ 5,5 fois inférieur à celui des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurNous Research
Poids🟢 Poids ouverts
Date de sortie26 août 2025
Connaissances jusqu'à2024-08-31
Multimodalnon
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)83,0 %102ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)79,0 %103ᵉ / 140benchable✅ Mesuré
Benchable : Reasoning (Baseline)72,0 %89ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)61,0 %83ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ Hermes 4 405B100 %

Benchable : Ethics (Baseline)

▶ Hermes 4 405B100 %
command-r-plus-08-202499 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Nebius Token Factory1 $3 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 52 % en dessous de la moyenne des LLM similaires, et 5,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,04 $
Latence moyenne par benchmark — Benchable4 min 25 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. La longue fenêtre de contexte convient au traitement de contenus volumineux. Le modèle peut afficher son raisonnement entre balises <think>, puis déclencher plusieurs appels de fonctions ou d’outils dans un même tour avec <tool_call>. Son entraînement au respect de schémas JSON et à la réparation d’objets mal formés répond aux besoins d’intégration structurée. Sur Benchable, Email Classification obtient un résultat brut élevé et partage la 11e place avec 40 autres modèles. Hallucinations et Ethics atteignent le plafond, avec une première place partagée respectivement avec 45 et 71 autres modèles. Ces tests ne départagent donc pas réellement les modèles.

Limites et points d'attention. Les résultats sont nettement plus faibles en Coding, où le modèle partage la 102e place sur 162, et en Mathematics, où il partage la 103e place sur 140. General Knowledge atteint aussi le plafond, mais ne se classe que 47e ex æquo avec 24 autres modèles, ce qui confirme le faible pouvoir discriminant de ce benchmark. Ses connaissances s’arrêtent au 31 août 2024. Nous: Hermes 4 405B reste surtout pertinent pour des usages à long contexte, avec sorties JSON, appels d’outils et maîtrise des coûts.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).