Llama 3-70B
Publié par Meta le 18 avril 2024, Llama 3-70B est un LLM américain de 70 milliards de paramètres. Près de deux ans après sa sortie, il appartient déjà à une génération très ancienne à l’échelle de l’IA. Ses performances sont probablement dépassées et les modèles de cet âge sont souvent…
Publié par Meta le 18 avril 2024, Llama 3-70B est un LLM américain de 70 milliards de paramètres. Près de deux ans après sa sortie, il appartient déjà à une génération très ancienne à l’échelle de l’IA. Ses performances sont probablement dépassées et les modèles de cet âge sont souvent retirés du catalogue de leur éditeur.
Llama 3-70B se distinguait pourtant dans le haut du panier de sa génération. Son entraînement a mobilisé 7,9 × 10²⁴ FLOP, soit environ 2,2 millions d’heures-GPU H100, l’équivalent de 1 000 GPU H100 pendant trois mois.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meta |
| Poids | ▫ n.d. |
| Date de sortie | 18 avril 2024 |
| Paramètres | 70 milliards |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: GPQA diamond | 40,6 % | 60ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: MATH level 5 | 22,6 % | 45ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 4,3 % | 51ᵉ / 64 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: GPQA diamond
Epoch: MATH level 5
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 7,9 × 10²⁴ FLOP |
| Taille du jeu d'entraînement | 1,5 × 10¹³ |
| Jeu de données | Llama 3 dataset |
| Matériel | NVIDIA H100 SXM5 80GB |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, Llama 3-70B figurait dans le top 24% des 21 LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Ce classement en faisait alors un modèle solide pour le raisonnement scientifique complexe. Son résultat de 41% constituait son principal point fort parmi les évaluations présentées. Cette position historique explique l’importance du modèle lors de sa publication, malgré des résultats désormais modestes face à des systèmes plus récents.
Limites et points d’attention. Les classements actuels placent Llama 3-70B dans le dernier tiers sur GPQA diamond et en net retrait sur MATH level 5. Sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, son score atteint 4% et il partage la 51e place sur 64 avec un autre modèle. Ce benchmark plafonné reste peu discriminant, mais le résultat demeure faible. À près de deux ans, ses performances sont aujourd’hui largement dépassées et sa présence au catalogue de Meta n’est plus assurée. L’effort d’entraînement reste marquant : environ 1 000 GPU H100 mobilisés pendant trois mois.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.