Llama 3.1-8B
Llama 3.1-8B est un LLM publié par Meta le 23 juillet 2024. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA, où les évolutions de performances et les renouvellements de catalogues sont rapides.
Llama 3.1-8B est un LLM publié par Meta le 23 juillet 2024. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA, où les évolutions de performances et les renouvellements de catalogues sont rapides.
À son lancement, il figurait dans le top 90% des 29 LLM de sa génération sur GPQA diamond. Ce positionnement le situe dans son contexte historique, sans en faire une référence durable face aux modèles plus récents.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meta |
| Poids | ▫ n.d. |
| Date de sortie | 23 juillet 2024 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: GPQA diamond | 25,9 % | 81ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: MATH level 5 | 22,9 % | 43ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 2,5 % | 55ᵉ / 64 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: GPQA diamond
Epoch: MATH level 5
Notre analyse
Forces. À sa sortie, Llama 3.1-8B appartenait au top 90% des LLM de sa génération sur GPQA diamond, un benchmark de questions scientifiques de niveau doctorat. Parmi les trois évaluations disponibles, son résultat sur MATH level 5 est le moins en retrait dans le classement. Le modèle y occupe toutefois la partie basse du tableau, ce qui limite la portée de cette relative avance.
Limites et points d'attention. Les classements actuels montrent un modèle largement dépassé. Llama 3.1-8B se place près du bas du tableau sur GPQA diamond et reste en retrait sur MATH level 5. Sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, son score de 2% le conduit à partager la 55e place avec trois autres modèles. Ce benchmark plafonné est peu discriminant, mais le résultat reste faible. Son ancienneté renforce ce constat : les modèles de cette période sont souvent retirés des catalogues des éditeurs au profit de générations plus récentes.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.