Llama 3.1-70B

Llama 3.1-70B est un grand modèle de langage publié par Meta le 23 juillet 2024. À sa sortie, il se plaçait dans le haut du panier de sa génération sur GPQA diamond, un benchmark de questions scientifiques de niveau doctorat.

Llama 3.1-70B est un grand modèle de langage publié par Meta le 23 juillet 2024. À sa sortie, il se plaçait dans le haut du panier de sa génération sur GPQA diamond, un benchmark de questions scientifiques de niveau doctorat.

Près de deux ans plus tard, son ancienneté est très importante à l’échelle de l’IA. Cette fiche présente donc surtout un modèle marquant de sa période, désormais probablement dépassé par des systèmes plus récents et souvent retiré des catalogues de leur éditeur.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids▫ n.d.
Date de sortie23 juillet 2024

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond44,2 %53ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 536,7 %37ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20253,6 %53ᵉ / 64epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

Tulu 346 %
▶ Llama 3.1-70B44 %

Epoch: MATH level 5

GPT-598 %
Tulu 343 %
▶ Llama 3.1-70B37 %

Notre analyse

Forces. Le principal point fort de Llama 3.1-70B apparaît sur GPQA diamond (questions scientifiques de niveau doctorat). À sa sortie, il appartenait au top 21 % des 39 LLM de sa génération sur cette évaluation. Ce résultat le situait clairement dans le haut du classement de son époque pour le raisonnement scientifique avancé. Les deux sources de données disponibles sont concordantes, ce qui renforce la cohérence de ce positionnement historique.

Limites et points d'attention. Les résultats actuels montrent un net décrochage. Llama 3.1-70B se trouve désormais dans le bas du classement sur GPQA diamond. Sa position sur MATH level 5 est intermédiaire à faible, tandis que son résultat sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée) est particulièrement bas. Ces écarts indiquent que son bon positionnement initial ne se maintient pas face à un ensemble plus récent de modèles. Près de deux ans après sa sortie, ses performances sont largement dépassées et ce type de modèle ancien est souvent retiré du catalogue de son éditeur.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.