Nous: Hermes 4 70B

Publié le 26 août 2025 par Nous Research, Nous: Hermes 4 70B est un LLM à poids ouverts basé sur Llama-3.1-70B. Ce modèle hybride peut produire une réponse directe ou activer un raisonnement explicite dans des segments <think>.

Publié le 26 août 2025 par Nous Research, Nous: Hermes 4 70B est un LLM à poids ouverts basé sur Llama-3.1-70B. Ce modèle hybride peut produire une réponse directe ou activer un raisonnement explicite dans des segments <think>.

Sa fenêtre de contexte atteint 131 072 tokens. Le modèle est entraîné à générer du JSON conforme à un schéma, à réparer des objets mal formés et à appeler des fonctions ou des outils. Son tarif très économique se situe 94% sous la moyenne des LLM similaires et environ 42.3 fois sous celui des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurNous Research
Poids🟢 Poids ouverts
Date de sortie26 août 2025
Connaissances jusqu'à2024-08-31
Multimodalnon
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)99,0 %73ᵉ / 159benchable✅ Mesuré
Benchable : Hallucinations (Baseline)98,0 %47ᵉ / 146benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : General Knowledge (Baseline)96,5 %106ᵉ / 161benchable✅ Mesuré
Benchable : Mathematics (Baseline)69,0 %115ᵉ / 140benchable✅ Mesuré
Benchable : Instruction Following (Baseline)55,1 %100ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)55,0 %140ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)54,0 %114ᵉ / 155benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

ui-tars-1.5-7b99 %
▶ Hermes 4 70B99 %
uncensored99 %

Benchable : Hallucinations (Baseline)

▶ Hermes 4 70B98 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Nebius Token Factory0,13 $0,4 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 94 % en dessous de la moyenne des LLM similaires, et 42,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable3 min 14 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Nous: Hermes 4 70B obtient des scores élevés sur les baselines Ethics, Hallucinations, Email Classification et General Knowledge. Ces benchmarks sont toutefois plafonnés et comptent de nombreux ex æquo, ce qui limite leur pouvoir discriminant. Ses fonctions les plus concrètes concernent les sorties structurées, notamment le JSON conforme à un schéma et la réparation d’objets mal formés. Il prend aussi en charge les appels d’outils dans un tour assistant. Sa longue fenêtre de contexte, ses poids ouverts et son faible coût renforcent son intérêt pour des traitements volumineux et structurés.

Limites et points d'attention. Les résultats sont nettement plus faibles en Mathematics, où le modèle se classe 115e sur 140, et en Instruction Following, avec un rang de 100e sur 163. General Knowledge affiche un score brut élevé, mais le modèle partage seulement la 106e place sur 161 avec cinq autres modèles. Ses connaissances s’arrêtent au 31 août 2024. Nous: Hermes 4 70B reste surtout pertinent lorsque le coût, la fenêtre de contexte, les poids ouverts et la génération structurée priment sur les performances en mathématiques et le suivi précis des consignes.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).