Llama 3-70B

Publié par Meta le 18 avril 2024, Llama 3-70B est un LLM américain de 70 milliards de paramètres. Près de deux ans après sa sortie, il appartient déjà à une génération très ancienne à l’échelle de l’IA. Ses performances sont probablement dépassées et les modèles de cet âge sont souvent…

Publié par Meta le 18 avril 2024, Llama 3-70B est un LLM américain de 70 milliards de paramètres. Près de deux ans après sa sortie, il appartient déjà à une génération très ancienne à l’échelle de l’IA. Ses performances sont probablement dépassées et les modèles de cet âge sont souvent retirés du catalogue de leur éditeur.

Llama 3-70B se distinguait pourtant dans le haut du panier de sa génération. Son entraînement a mobilisé 7,9 × 10²⁴ FLOP, soit environ 2,2 millions d’heures-GPU H100, l’équivalent de 1 000 GPU H100 pendant trois mois.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids▫ n.d.
Date de sortie18 avril 2024
Paramètres70 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond40,6 %60ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 522,6 %45ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20254,3 %51ᵉ / 64epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

▶ Llama 3-70B41 %
Hermes 2 Theta Llama-3 …37 %

Epoch: MATH level 5

GPT-598 %
Hermes 2 Theta Llama-3 …23 %
▶ Llama 3-70B23 %
DBRX12 %

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement7,9 × 10²⁴ FLOP
Taille du jeu d'entraînement1,5 × 10¹³
Jeu de donnéesLlama 3 dataset
MatérielNVIDIA H100 SXM5 80GB
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Llama 3-70B figurait dans le top 24% des 21 LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Ce classement en faisait alors un modèle solide pour le raisonnement scientifique complexe. Son résultat de 41% constituait son principal point fort parmi les évaluations présentées. Cette position historique explique l’importance du modèle lors de sa publication, malgré des résultats désormais modestes face à des systèmes plus récents.

Limites et points d’attention. Les classements actuels placent Llama 3-70B dans le dernier tiers sur GPQA diamond et en net retrait sur MATH level 5. Sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, son score atteint 4% et il partage la 51e place sur 64 avec un autre modèle. Ce benchmark plafonné reste peu discriminant, mais le résultat demeure faible. À près de deux ans, ses performances sont aujourd’hui largement dépassées et sa présence au catalogue de Meta n’est plus assurée. L’effort d’entraînement reste marquant : environ 1 000 GPU H100 mobilisés pendant trois mois.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.