Hermes 3 70B

Hermes 3 70B est un LLM généraliste open-weights de Nous Research, publié le 15 août 2024 sous licence Apache 2.0. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances sont probablement dépassées par celles des modèles récents.

Hermes 3 70B est un LLM généraliste open-weights de Nous Research, publié le 15 août 2024 sous licence Apache 2.0. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances sont probablement dépassées par celles des modèles récents.

Ce modèle de 70 milliards de paramètres se distingue par une fenêtre de contexte de 131 072 tokens et un positionnement très économique. Il cible notamment le raisonnement, les interactions agentiques, la conversation multi-tour, le jeu de rôle, la génération de code, l’appel de fonctions et les sorties structurées.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurNous Research
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie15 août 2024
Multimodalnon
Paramètres70 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MT-Bench89,9 %4ᵉ / 12llm-statsAuto-déclaré
HellaSwag88,2 %7ᵉ / 27llm-statsAuto-déclaré
BoolQ88,0 %1ᵉ / 10llm-statsAuto-déclaré
PIQA84,4 %2ᵉ / 11llm-statsAuto-déclaré
Winogrande83,2 %7ᵉ / 22llm-statsAuto-déclaré
ARC-E83,0 %3ᵉ / 8llm-statsAuto-déclaré
IFBench81,2 %2ᵉ / 27llm-statsAuto-déclaré
MMLU79,1 %64ᵉ / 98llm-statsAuto-déclaré
BBH67,8 %11ᵉ / 12llm-statsAuto-déclaré
GPQA66,1 %133ᵉ / 219llm-statsAuto-déclaré
ARC-C65,5 %27ᵉ / 34llm-statsAuto-déclaré
TruthfulQA63,3 %6ᵉ / 18llm-statsAuto-déclaré
AGIEval56,2 %4ᵉ / 10llm-statsAuto-déclaré
OpenBookQA49,4 %5ᵉ / 5llm-statsAuto-déclaré
MMLU-Pro47,2 %114ᵉ / 125llm-statsAuto-déclaré
MATH20,8 %69ᵉ / 70llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,7 $0,7 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 66 % en dessous de la moyenne des LLM similaires, et 7,9 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Notre analyse

Forces. À sa sortie, Hermes 3 70B figurait dans le top 10% des 31 LLM de sa génération sur GPQA, un benchmark consacré aux questions scientifiques complexes. Ce résultat le plaçait alors dans le haut du panier pour le raisonnement évalué par ce test. Sa fenêtre de 131 072 tokens favorise le traitement de longs contextes et la cohérence au fil d’échanges étendus. Le modèle accepte le format ChatML, les messages système, l’appel de fonctions au moyen de balises XML et un mode JSON fondé sur un schéma. Il peut être exécuté avec Hugging Face Transformers ou vLLM, notamment dans des versions quantifiées GGUF et FP8. Sa licence Apache 2.0 autorise l’usage commercial.

Limites et points d’attention. Son ancienneté est très importante dans un secteur qui évolue rapidement. Ses performances sont aujourd’hui probablement largement dépassées, et un modèle de cette période est souvent retiré du catalogue de son éditeur. Ses connaissances s’arrêtent au 31 décembre 2023. Son principal avantage actuel reste économique : ses tarifs sont inférieurs de 65% à la moyenne des LLM similaires et environ 7,9 fois plus bas que ceux des modèles frontière, avec un prix identique de 0,7 $ par million de tokens en entrée comme en sortie.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).