Llama 3.1-8B

Llama 3.1-8B est un LLM publié par Meta le 23 juillet 2024. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA, où les évolutions de performances et les renouvellements de catalogues sont rapides.

Llama 3.1-8B est un LLM publié par Meta le 23 juillet 2024. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA, où les évolutions de performances et les renouvellements de catalogues sont rapides.

À son lancement, il figurait dans le top 90% des 29 LLM de sa génération sur GPQA diamond. Ce positionnement le situe dans son contexte historique, sans en faire une référence durable face aux modèles plus récents.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids▫ n.d.
Date de sortie23 juillet 2024

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond25,9 %81ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 522,9 %43ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20252,5 %55ᵉ / 64epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

Yi-1.5-34B32 %
▶ Llama 3.1-8B26 %

Epoch: MATH level 5

GPT-598 %
Yi-1.5-34B25 %
▶ Llama 3.1-8B23 %
Hermes 2 Theta Llama-3 …23 %

Notre analyse

Forces. À sa sortie, Llama 3.1-8B appartenait au top 90% des LLM de sa génération sur GPQA diamond, un benchmark de questions scientifiques de niveau doctorat. Parmi les trois évaluations disponibles, son résultat sur MATH level 5 est le moins en retrait dans le classement. Le modèle y occupe toutefois la partie basse du tableau, ce qui limite la portée de cette relative avance.

Limites et points d'attention. Les classements actuels montrent un modèle largement dépassé. Llama 3.1-8B se place près du bas du tableau sur GPQA diamond et reste en retrait sur MATH level 5. Sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, son score de 2% le conduit à partager la 55e place avec trois autres modèles. Ce benchmark plafonné est peu discriminant, mais le résultat reste faible. Son ancienneté renforce ce constat : les modèles de cette période sont souvent retirés des catalogues des éditeurs au profit de générations plus récentes.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.