Llama 2-70B

Llama 2-70B est un LLM de 70 milliards de paramètres publié par Meta aux États-Unis le 18 juillet 2023. Près de trois ans plus tard, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses résultats doivent être replacés dans le contexte de sa période de sortie.

Llama 2-70B est un LLM de 70 milliards de paramètres publié par Meta aux États-Unis le 18 juillet 2023. Près de trois ans plus tard, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses résultats doivent être replacés dans le contexte de sa période de sortie.

Son entraînement reste marquant par son ampleur : 8,1 × 10²³ FLOP, soit environ 225 000 heures-GPU H100 ou l’équivalent de 100 GPU H100 mobilisés pendant trois mois. Son coût d’entraînement est estimé à 1,1 million de dollars de 2023, selon deux sources concordantes.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids▫ n.d.
Date de sortie18 juillet 2023
Paramètres70 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond26,3 %79ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 53,3 %59ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20250,0 %64ᵉ / 64epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

Yi-1.5-34B32 %
▶ Llama 2-70B26 %

Epoch: MATH level 5

GPT-598 %
▶ Llama 2-70B3 %

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement8,1 × 10²³ FLOP
Taille du jeu d'entraînement2,0 × 10¹²
Jeu de donnéesLlama 2 dataset
Coût d'entraînement estimé≈ 1 102 561 $ (USD 2023)
MatérielNVIDIA A100 SXM4 80 GB
Nombre de puces1 000
Puissance électrique795 557 W
Durée d'entraînement1 728 h
PaysUnited States of America

Notre analyse

Forces. La principale caractéristique de Llama 2-70B tient à son échelle et à l’effort consacré à son entraînement. Ses 70 milliards de paramètres et un calcul de 8,1 × 10²³ FLOP en faisaient un modèle particulièrement lourd de sa génération. Parmi les trois évaluations fournies, GPQA diamond constitue son résultat le moins faible : le modèle répond correctement à 26 % de questions scientifiques de niveau doctorat. Ce score reste modeste, mais il montre une capacité partielle sur des problèmes scientifiques avancés, contrairement aux épreuves mathématiques les plus exigeantes où ses résultats deviennent presque inexistants.

Limites et points d’attention. Les benchmarks placent aujourd’hui Llama 2-70B près du bas des classements. Il obtient 3 % à MATH level 5 et termine dernier, puis 0 % à OTIS Mock AIME 2024-2025, également au dernier rang. Même sur GPQA diamond, il se classe 131e sur 137. Ces résultats signalent de fortes limites en raisonnement scientifique et mathématique complexe. Près de trois ans après sa sortie, ses performances sont largement dépassées et le modèle n’est souvent plus proposé par son éditeur. L’investissement initial demeure néanmoins notable : environ 225 000 heures-GPU H100 et 1,1 million de dollars de coût estimé.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.