Nous: Hermes 4 70B
Publié le 26 août 2025 par Nous Research, Nous: Hermes 4 70B est un LLM à poids ouverts basé sur Llama-3.1-70B. Ce modèle hybride peut produire une réponse directe ou activer un raisonnement explicite dans des segments <think>.
Publié le 26 août 2025 par Nous Research, Nous: Hermes 4 70B est un LLM à poids ouverts basé sur Llama-3.1-70B. Ce modèle hybride peut produire une réponse directe ou activer un raisonnement explicite dans des segments <think>.
Sa fenêtre de contexte atteint 131 072 tokens. Le modèle est entraîné à générer du JSON conforme à un schéma, à réparer des objets mal formés et à appeler des fonctions ou des outils. Son tarif très économique se situe 94% sous la moyenne des LLM similaires et environ 42.3 fois sous celui des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Nous Research |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 26 août 2025 |
| Connaissances jusqu'à | 2024-08-31 |
| Multimodal | non |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 99,0 % | 73ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 98,0 % | 47ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 96,5 % | 106ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 69,0 % | 115ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 55,1 % | 100ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 55,0 % | 140ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 54,0 % | 114ᵉ / 155 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Ethics (Baseline)
Benchable : Hallucinations (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Nebius Token Factory | 0,13 $ | 0,4 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 94 % en dessous de la moyenne des LLM similaires, et 42,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 3 min 14 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Nous: Hermes 4 70B obtient des scores élevés sur les baselines Ethics, Hallucinations, Email Classification et General Knowledge. Ces benchmarks sont toutefois plafonnés et comptent de nombreux ex æquo, ce qui limite leur pouvoir discriminant. Ses fonctions les plus concrètes concernent les sorties structurées, notamment le JSON conforme à un schéma et la réparation d’objets mal formés. Il prend aussi en charge les appels d’outils dans un tour assistant. Sa longue fenêtre de contexte, ses poids ouverts et son faible coût renforcent son intérêt pour des traitements volumineux et structurés.
Limites et points d'attention. Les résultats sont nettement plus faibles en Mathematics, où le modèle se classe 115e sur 140, et en Instruction Following, avec un rang de 100e sur 163. General Knowledge affiche un score brut élevé, mais le modèle partage seulement la 106e place sur 161 avec cinq autres modèles. Ses connaissances s’arrêtent au 31 août 2024. Nous: Hermes 4 70B reste surtout pertinent lorsque le coût, la fenêtre de contexte, les poids ouverts et la génération structurée priment sur les performances en mathématiques et le suivi précis des consignes.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).