Llama 3.1 70B Instruct
Publié par Meta le 23 juillet 2024, Llama 3.1 70B Instruct est un LLM de 70 milliards de paramètres conçu pour suivre des instructions. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA et se trouve probablement dépassé par des modèles…
Publié par Meta le 23 juillet 2024, Llama 3.1 70B Instruct est un LLM de 70 milliards de paramètres conçu pour suivre des instructions. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA et se trouve probablement dépassé par des modèles plus récents.
Sa fenêtre de contexte de 131 072 tokens reste notable, tandis que ses connaissances s’arrêtent au 31 décembre 2023. Distribué sous Llama 3.1 Community License avec des poids non ouverts, il se distingue surtout par un tarif très économique, inférieur de 80% à la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts · usage commercial restreint (recherche / non commercial) |
| Licence | Llama 3.1 Community License |
| Date de sortie | 23 juillet 2024 |
| Multimodal | non |
| Paramètres | 70 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| ARC-C | 94,8 % | 4ᵉ / 34 | llm-stats | Auto-déclaré |
| API-Bank | 90,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| IFEval | 87,5 % | 32ᵉ / 65 | llm-stats | Auto-déclaré |
| Multilingual MGSM (CoT) | 86,9 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| MMLU (CoT) | 86,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| BFCL | 84,8 % | 2ᵉ / 11 | llm-stats | Auto-déclaré |
| MMLU | 83,6 % | 45ᵉ / 98 | llm-stats | Auto-déclaré |
| HumanEval | 80,5 % | 44ᵉ / 65 | llm-stats | Auto-déclaré |
| DROP | 79,6 % | 13ᵉ / 29 | llm-stats | Auto-déclaré |
| MATH (CoT) | 68,0 % | 1ᵉ / 6 | llm-stats | Auto-déclaré |
| MMLU-Pro | 66,4 % | 94ᵉ / 125 | llm-stats | Auto-déclaré |
| Multipl-E HumanEval | 65,5 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| Multipl-E MBPP | 62,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| Nexus | 56,7 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| GPQA | 41,7 % | 186ᵉ / 219 | llm-stats | Auto-déclaré |
| Gorilla Benchmark API Bench | 29,7 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra (Turbo) | 0,4 $ | 0,4 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 81 % en dessous de la moyenne des LLM similaires, et 13,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 5 $ |
| Durée d'exécution — PinchBench | 4 h 32 min |
| Indice valeur/coût — PinchBench | 2,14 |
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 3 min 44 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Llama 3.1 70B Instruct excelle dans Ethics (Baseline), où il obtient un score parfait et occupe la première place. Il affiche également des résultats bruts élevés en Email Classification, General Knowledge et Hallucinations, même si ses classements sur ces tests sont moins remarquables. À sa sortie, son résultat sur GPQA le plaçait dans le top 44% des 25 LLM de sa génération, soit dans la moitié supérieure sans appartenir au groupe de tête. Son autre avantage majeur reste son coût : ses tarifs d’entrée et de sortie sont environ 13,8 fois inférieurs à ceux des modèles frontière.
Limites et points d'attention. Les résultats en Instruction Following et en Reasoning sont faibles, avec des positions situées dans le dernier tiers ou à proximité parmi les modèles évalués. Les scores élevés observés sur certaines tâches doivent aussi être relativisés par des rangs de milieu de tableau, notamment en connaissances générales et en maîtrise des hallucinations. Son ancienneté constitue désormais une limite centrale : ses performances sont probablement largement dépassées et le modèle est souvent retiré du catalogue de l’éditeur. Sa date limite de connaissances, fixée à fin 2023, réduit aussi sa pertinence pour les sujets récents.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).