Llama 3.3 70B
Llama 3.3 70B est un LLM de 70 milliards de paramètres publié par Meta aux États-Unis le 6 décembre 2024. Désormais ancien d’environ deux ans, un intervalle très long à l’échelle de l’IA, il doit être replacé parmi les modèles de sa période plutôt que comparé directement aux systèmes…
Llama 3.3 70B est un LLM de 70 milliards de paramètres publié par Meta aux États-Unis le 6 décembre 2024. Désormais ancien d’environ deux ans, un intervalle très long à l’échelle de l’IA, il doit être replacé parmi les modèles de sa période plutôt que comparé directement aux systèmes actuels.
Son entraînement représente 6,9 × 10²⁴ FLOP, soit environ 1,9 million d’heures-GPU H100. Cette charge équivaut à près de 880 GPU H100 fonctionnant pendant trois mois, un ordre de grandeur qui illustre l’effort de calcul consacré à ce modèle.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meta |
| Poids | ▫ n.d. |
| Date de sortie | 6 décembre 2024 |
| Paramètres | 70 milliards |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: GPQA diamond | 47,4 % | 48ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: MATH level 5 | 41,6 % | 32ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 5,1 % | 48ᵉ / 64 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: GPQA diamond
Epoch: MATH level 5
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 6,9 × 10²⁴ FLOP |
| Taille du jeu d'entraînement | 1,5 × 10¹³ |
| Jeu de données | Unspecified unreleased |
| Matériel | NVIDIA H100 SXM5 80GB |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, Llama 3.3 70B se classait dans le top 22% des LLM de sa génération sur GPQA diamond, un benchmark de questions scientifiques de niveau doctorat. Ce résultat le plaçait dans le haut du panier parmi les 51 modèles publiés au cours des quelque 18 mois précédents. MATH level 5 indique aussi une capacité réelle à traiter des problèmes mathématiques difficiles, même si son classement y restait plus proche du milieu de tableau. Ces résultats, confirmés par deux sources de données concordantes, décrivent un modèle compétitif pour sa période.
Limites et points d'attention. Environ deux ans après sa sortie, ses performances sont largement dépassées à l’échelle actuelle et un modèle de cette ancienneté est souvent retiré du catalogue de son éditeur. Son faible résultat sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, révèle une difficulté marquée sur ce type de raisonnement. Son classement actuel sur GPQA diamond se situe également dans la partie basse du panel évalué. L’effort d’entraînement reste néanmoins notable, avec l’équivalent de 880 GPU H100 mobilisés pendant trois mois.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.