Llama 3.2 90B

Llama 3.2 90B est un LLM publié par Meta le 24 septembre 2024. À sa sortie, il se plaçait dans le tiers supérieur des modèles de sa génération sur GPQA diamond, un test exigeant de questions scientifiques de niveau doctorat.

Llama 3.2 90B est un LLM publié par Meta le 24 septembre 2024. À sa sortie, il se plaçait dans le tiers supérieur des modèles de sa génération sur GPQA diamond, un test exigeant de questions scientifiques de niveau doctorat.

Près de deux ans plus tard, son ancienneté est très importante à l’échelle de l’IA. La fiche présente donc surtout un modèle notable dans le contexte de 2024, mais vraisemblablement dépassé par les modèles plus récents.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids▫ n.d.
Date de sortie24 septembre 2024

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond41,0 %57ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 539,4 %34ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20252,6 %54ᵉ / 64epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

▶ Llama 3.2 90B41 %
Hermes 2 Theta Llama-3 …37 %

Epoch: MATH level 5

GPT-598 %
Tulu 343 %
▶ Llama 3.2 90B39 %

Notre analyse

Forces. À sa sortie, Llama 3.2 90B appartenait au top 35% des LLM de sa génération sur GPQA diamond. Ce résultat le situait dans le haut du panier de son époque pour répondre à des questions scientifiques de niveau doctorat. Parmi les trois évaluations disponibles, GPQA diamond constitue son principal point fort historique. Son résultat sur MATH level 5 est moins distinctif, mais reste nettement supérieur à celui obtenu sur l’épreuve d’olympiades mathématiques.

Limites et points d’attention. Les classements élargis placent désormais le modèle dans le bas du tableau sur GPQA diamond et dans la seconde moitié sur MATH level 5. Sa faiblesse est particulièrement marquée sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, où il figure parmi les modèles les moins performants. Près de deux ans après sa sortie, ses performances sont vraisemblablement largement dépassées, et les modèles de cette ancienneté sont souvent retirés du catalogue de leur éditeur.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.