Nous: Hermes 4 405B
Nous: Hermes 4 405B est un LLM à poids ouverts publié par Nous Research le 26 août 2025. Fondé sur Llama-3.1-405B, ce modèle de raisonnement hybride propose une fenêtre de contexte de 131 072 tokens et des connaissances arrêtées au 31 août 2024.
Nous: Hermes 4 405B est un LLM à poids ouverts publié par Nous Research le 26 août 2025. Fondé sur Llama-3.1-405B, ce modèle de raisonnement hybride propose une fenêtre de contexte de 131 072 tokens et des connaissances arrêtées au 31 août 2024.
Son post-entraînement privilégie les raisonnements vérifiés, les mathématiques, le code, les STEM, la logique, la créativité et le respect des formats. Il gère le raisonnement explicite, les appels d’outils et la production ou la réparation de JSON. Son tarif est très économique, 52% sous la moyenne des LLM similaires et environ 5,5 fois inférieur à celui des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Nous Research |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 26 août 2025 |
| Connaissances jusqu'à | 2024-08-31 |
| Multimodal | non |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 83,0 % | 102ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 79,0 % | 103ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 72,0 % | 89ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 61,0 % | 83ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Hallucinations (Baseline)
Benchable : Ethics (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Nebius Token Factory | 1 $ | 3 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 52 % en dessous de la moyenne des LLM similaires, et 5,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,04 $ |
| Latence moyenne par benchmark — Benchable | 4 min 25 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. La longue fenêtre de contexte convient au traitement de contenus volumineux. Le modèle peut afficher son raisonnement entre balises <think>, puis déclencher plusieurs appels de fonctions ou d’outils dans un même tour avec <tool_call>. Son entraînement au respect de schémas JSON et à la réparation d’objets mal formés répond aux besoins d’intégration structurée. Sur Benchable, Email Classification obtient un résultat brut élevé et partage la 11e place avec 40 autres modèles. Hallucinations et Ethics atteignent le plafond, avec une première place partagée respectivement avec 45 et 71 autres modèles. Ces tests ne départagent donc pas réellement les modèles.
Limites et points d'attention. Les résultats sont nettement plus faibles en Coding, où le modèle partage la 102e place sur 162, et en Mathematics, où il partage la 103e place sur 140. General Knowledge atteint aussi le plafond, mais ne se classe que 47e ex æquo avec 24 autres modèles, ce qui confirme le faible pouvoir discriminant de ce benchmark. Ses connaissances s’arrêtent au 31 août 2024. Nous: Hermes 4 405B reste surtout pertinent pour des usages à long contexte, avec sorties JSON, appels d’outils et maîtrise des coûts.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).