Llama 3.1 70B Instruct

Publié par Meta le 23 juillet 2024, Llama 3.1 70B Instruct est un LLM de 70 milliards de paramètres conçu pour suivre des instructions. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA et se trouve probablement dépassé par des modèles…

Publié par Meta le 23 juillet 2024, Llama 3.1 70B Instruct est un LLM de 70 milliards de paramètres conçu pour suivre des instructions. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA et se trouve probablement dépassé par des modèles plus récents.

Sa fenêtre de contexte de 131 072 tokens reste notable, tandis que ses connaissances s’arrêtent au 31 décembre 2023. Distribué sous Llama 3.1 Community License avec des poids non ouverts, il se distingue surtout par un tarif très économique, inférieur de 80% à la moyenne des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
LicenceLlama 3.1 Community License
Date de sortie23 juillet 2024
Multimodalnon
Paramètres70 milliards
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
ARC-C94,8 %4ᵉ / 34llm-statsAuto-déclaré
API-Bank90,0 %2ᵉ / 3llm-statsAuto-déclaré
IFEval87,5 %32ᵉ / 65llm-statsAuto-déclaré
Multilingual MGSM (CoT)86,9 %2ᵉ / 3llm-statsAuto-déclaré
MMLU (CoT)86,0 %2ᵉ / 3llm-statsAuto-déclaré
BFCL84,8 %2ᵉ / 11llm-statsAuto-déclaré
MMLU83,6 %45ᵉ / 98llm-statsAuto-déclaré
HumanEval80,5 %44ᵉ / 65llm-statsAuto-déclaré
DROP79,6 %13ᵉ / 29llm-statsAuto-déclaré
MATH (CoT)68,0 %1ᵉ / 6llm-statsAuto-déclaré
MMLU-Pro66,4 %94ᵉ / 125llm-statsAuto-déclaré
Multipl-E HumanEval65,5 %2ᵉ / 3llm-statsAuto-déclaré
Multipl-E MBPP62,0 %2ᵉ / 3llm-statsAuto-déclaré
Nexus56,7 %2ᵉ / 4llm-statsAuto-déclaré
GPQA41,7 %186ᵉ / 219llm-statsAuto-déclaré
Gorilla Benchmark API Bench29,7 %2ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra (Turbo)0,4 $0,4 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 81 % en dessous de la moyenne des LLM similaires, et 13,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)5 $
Durée d'exécution — PinchBench4 h 32 min
Indice valeur/coût — PinchBench2,14
Coût moyen par benchmark — Benchable0 $
Latence moyenne par benchmark — Benchable3 min 44 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Llama 3.1 70B Instruct excelle dans Ethics (Baseline), où il obtient un score parfait et occupe la première place. Il affiche également des résultats bruts élevés en Email Classification, General Knowledge et Hallucinations, même si ses classements sur ces tests sont moins remarquables. À sa sortie, son résultat sur GPQA le plaçait dans le top 44% des 25 LLM de sa génération, soit dans la moitié supérieure sans appartenir au groupe de tête. Son autre avantage majeur reste son coût : ses tarifs d’entrée et de sortie sont environ 13,8 fois inférieurs à ceux des modèles frontière.

Limites et points d'attention. Les résultats en Instruction Following et en Reasoning sont faibles, avec des positions situées dans le dernier tiers ou à proximité parmi les modèles évalués. Les scores élevés observés sur certaines tâches doivent aussi être relativisés par des rangs de milieu de tableau, notamment en connaissances générales et en maîtrise des hallucinations. Son ancienneté constitue désormais une limite centrale : ses performances sont probablement largement dépassées et le modèle est souvent retiré du catalogue de l’éditeur. Sa date limite de connaissances, fixée à fin 2023, réduit aussi sa pertinence pour les sujets récents.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).