Llama 2-70B
Llama 2-70B est un LLM de 70 milliards de paramètres publié par Meta aux États-Unis le 18 juillet 2023. Près de trois ans plus tard, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses résultats doivent être replacés dans le contexte de sa période de sortie.
Llama 2-70B est un LLM de 70 milliards de paramètres publié par Meta aux États-Unis le 18 juillet 2023. Près de trois ans plus tard, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses résultats doivent être replacés dans le contexte de sa période de sortie.
Son entraînement reste marquant par son ampleur : 8,1 × 10²³ FLOP, soit environ 225 000 heures-GPU H100 ou l’équivalent de 100 GPU H100 mobilisés pendant trois mois. Son coût d’entraînement est estimé à 1,1 million de dollars de 2023, selon deux sources concordantes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meta |
| Poids | ▫ n.d. |
| Date de sortie | 18 juillet 2023 |
| Paramètres | 70 milliards |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: GPQA diamond | 26,3 % | 79ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: MATH level 5 | 3,3 % | 59ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 0,0 % | 64ᵉ / 64 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: GPQA diamond
Epoch: MATH level 5
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 8,1 × 10²³ FLOP |
| Taille du jeu d'entraînement | 2,0 × 10¹² |
| Jeu de données | Llama 2 dataset |
| Coût d'entraînement estimé | ≈ 1 102 561 $ (USD 2023) |
| Matériel | NVIDIA A100 SXM4 80 GB |
| Nombre de puces | 1 000 |
| Puissance électrique | 795 557 W |
| Durée d'entraînement | 1 728 h |
| Pays | United States of America |
Notre analyse
Forces. La principale caractéristique de Llama 2-70B tient à son échelle et à l’effort consacré à son entraînement. Ses 70 milliards de paramètres et un calcul de 8,1 × 10²³ FLOP en faisaient un modèle particulièrement lourd de sa génération. Parmi les trois évaluations fournies, GPQA diamond constitue son résultat le moins faible : le modèle répond correctement à 26 % de questions scientifiques de niveau doctorat. Ce score reste modeste, mais il montre une capacité partielle sur des problèmes scientifiques avancés, contrairement aux épreuves mathématiques les plus exigeantes où ses résultats deviennent presque inexistants.
Limites et points d’attention. Les benchmarks placent aujourd’hui Llama 2-70B près du bas des classements. Il obtient 3 % à MATH level 5 et termine dernier, puis 0 % à OTIS Mock AIME 2024-2025, également au dernier rang. Même sur GPQA diamond, il se classe 131e sur 137. Ces résultats signalent de fortes limites en raisonnement scientifique et mathématique complexe. Près de trois ans après sa sortie, ses performances sont largement dépassées et le modèle n’est souvent plus proposé par son éditeur. L’investissement initial demeure néanmoins notable : environ 225 000 heures-GPU H100 et 1,1 million de dollars de coût estimé.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.