Llama 3.1 8B Instruct

Publié par Meta le 23 juillet 2024, Llama 3.1 8B Instruct est désormais ancien à l’échelle de l’IA. Avec 8 milliards de paramètres, il représente un LLM compact de sa période, aujourd’hui probablement dépassé et souvent retiré des catalogues de l’éditeur.

Publié par Meta le 23 juillet 2024, Llama 3.1 8B Instruct est désormais ancien à l’échelle de l’IA. Avec 8 milliards de paramètres, il représente un LLM compact de sa période, aujourd’hui probablement dépassé et souvent retiré des catalogues de l’éditeur.

Le modèle associe une fenêtre de contexte de 131 072 tokens à des connaissances arrêtées au 31 décembre 2023. Son principal avantage actuel reste son coût très économique, inférieur de 99% à la moyenne des LLM similaires. Sa licence Llama 3.1 Community License ne rend pas ses poids ouverts.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
LicenceLlama 3.1 Community License
Date de sortie23 juillet 2024
Connaissances jusqu'à2023-12-31
Multimodalnon
Paramètres8 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
ARC-C83,4 %16ᵉ / 34llm-statsAuto-déclaré
API-Bank82,6 %3ᵉ / 3llm-statsAuto-déclaré
IFEval80,4 %52ᵉ / 65llm-statsAuto-déclaré
BFCL76,1 %3ᵉ / 11llm-statsAuto-déclaré
MMLU (CoT)73,0 %3ᵉ / 3llm-statsAuto-déclaré
HumanEval72,6 %53ᵉ / 65llm-statsAuto-déclaré
MMLU69,4 %83ᵉ / 98llm-statsAuto-déclaré
Multilingual MGSM (CoT)68,9 %3ᵉ / 3llm-statsAuto-déclaré
DROP59,5 %23ᵉ / 29llm-statsAuto-déclaré
Multipl-E MBPP52,4 %3ᵉ / 3llm-statsAuto-déclaré
MATH (CoT)51,9 %6ᵉ / 6llm-statsAuto-déclaré
Multipl-E HumanEval50,8 %3ᵉ / 3llm-statsAuto-déclaré
MMLU-Pro48,3 %112ᵉ / 125llm-statsAuto-déclaré
Nexus38,5 %3ᵉ / 4llm-statsAuto-déclaré
GPQA30,4 %209ᵉ / 219llm-statsAuto-déclaré
Gorilla Benchmark API Bench8,2 %3ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,02 $0,03 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 99 % en dessous de la moyenne des LLM similaires, et 275 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0 $
Latence moyenne par benchmark — Benchable5 min 50 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Les meilleurs résultats bruts de Llama 3.1 8B Instruct concernent Ethics, Email Classification et General Knowledge. Sa fenêtre de 131 072 tokens constitue également une caractéristique notable pour un modèle de 8 milliards de paramètres. À sa sortie, il se classait dans le top 88% des 25 LLM de sa génération sur GPQA. Son avantage le plus net reste toutefois économique : ses tarifs minimaux atteignent 0,02 $ par million de tokens en entrée et 0,03 $ en sortie, soit environ 275 fois moins que les modèles frontière.

Limites et points d’attention. Les classements Benchable placent le modèle dans la partie basse des modèles évalués, y compris sur ses catégories affichant les meilleurs scores bruts. Instruction Following et Reasoning constituent ses faiblesses les plus marquées, tandis que Coding reste en retrait dans le classement comparatif. Près de deux ans après sa sortie, ses performances sont largement dépassées à l’échelle de l’IA et le modèle peut ne plus figurer au catalogue de l’éditeur. Ses connaissances s’arrêtent à fin 2023, ce qui limite aussi sa pertinence sur les informations plus récentes.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).