Llama 3.1-70B
Llama 3.1-70B est un grand modèle de langage publié par Meta le 23 juillet 2024. À sa sortie, il se plaçait dans le haut du panier de sa génération sur GPQA diamond, un benchmark de questions scientifiques de niveau doctorat.
Llama 3.1-70B est un grand modèle de langage publié par Meta le 23 juillet 2024. À sa sortie, il se plaçait dans le haut du panier de sa génération sur GPQA diamond, un benchmark de questions scientifiques de niveau doctorat.
Près de deux ans plus tard, son ancienneté est très importante à l’échelle de l’IA. Cette fiche présente donc surtout un modèle marquant de sa période, désormais probablement dépassé par des systèmes plus récents et souvent retiré des catalogues de leur éditeur.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meta |
| Poids | ▫ n.d. |
| Date de sortie | 23 juillet 2024 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: GPQA diamond | 44,2 % | 53ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: MATH level 5 | 36,7 % | 37ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 3,6 % | 53ᵉ / 64 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: GPQA diamond
Epoch: MATH level 5
Notre analyse
Forces. Le principal point fort de Llama 3.1-70B apparaît sur GPQA diamond (questions scientifiques de niveau doctorat). À sa sortie, il appartenait au top 21 % des 39 LLM de sa génération sur cette évaluation. Ce résultat le situait clairement dans le haut du classement de son époque pour le raisonnement scientifique avancé. Les deux sources de données disponibles sont concordantes, ce qui renforce la cohérence de ce positionnement historique.
Limites et points d'attention. Les résultats actuels montrent un net décrochage. Llama 3.1-70B se trouve désormais dans le bas du classement sur GPQA diamond. Sa position sur MATH level 5 est intermédiaire à faible, tandis que son résultat sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée) est particulièrement bas. Ces écarts indiquent que son bon positionnement initial ne se maintient pas face à un ensemble plus récent de modèles. Près de deux ans après sa sortie, ses performances sont largement dépassées et ce type de modèle ancien est souvent retiré du catalogue de son éditeur.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.