Llama 3.3 70B

Llama 3.3 70B est un LLM de 70 milliards de paramètres publié par Meta aux États-Unis le 6 décembre 2024. Désormais ancien d’environ deux ans, un intervalle très long à l’échelle de l’IA, il doit être replacé parmi les modèles de sa période plutôt que comparé directement aux systèmes…

Llama 3.3 70B est un LLM de 70 milliards de paramètres publié par Meta aux États-Unis le 6 décembre 2024. Désormais ancien d’environ deux ans, un intervalle très long à l’échelle de l’IA, il doit être replacé parmi les modèles de sa période plutôt que comparé directement aux systèmes actuels.

Son entraînement représente 6,9 × 10²⁴ FLOP, soit environ 1,9 million d’heures-GPU H100. Cette charge équivaut à près de 880 GPU H100 fonctionnant pendant trois mois, un ordre de grandeur qui illustre l’effort de calcul consacré à ce modèle.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids▫ n.d.
Date de sortie6 décembre 2024
Paramètres70 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond47,4 %48ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 541,6 %32ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20255,1 %48ᵉ / 64epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

▶ Llama 3.3 70B47 %
Tulu 346 %

Epoch: MATH level 5

GPT-598 %
Tulu 343 %
▶ Llama 3.3 70B42 %

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement6,9 × 10²⁴ FLOP
Taille du jeu d'entraînement1,5 × 10¹³
Jeu de donnéesUnspecified unreleased
MatérielNVIDIA H100 SXM5 80GB
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Llama 3.3 70B se classait dans le top 22% des LLM de sa génération sur GPQA diamond, un benchmark de questions scientifiques de niveau doctorat. Ce résultat le plaçait dans le haut du panier parmi les 51 modèles publiés au cours des quelque 18 mois précédents. MATH level 5 indique aussi une capacité réelle à traiter des problèmes mathématiques difficiles, même si son classement y restait plus proche du milieu de tableau. Ces résultats, confirmés par deux sources de données concordantes, décrivent un modèle compétitif pour sa période.

Limites et points d'attention. Environ deux ans après sa sortie, ses performances sont largement dépassées à l’échelle actuelle et un modèle de cette ancienneté est souvent retiré du catalogue de son éditeur. Son faible résultat sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, révèle une difficulté marquée sur ce type de raisonnement. Son classement actuel sur GPQA diamond se situe également dans la partie basse du panel évalué. L’effort d’entraînement reste néanmoins notable, avec l’équivalent de 880 GPU H100 mobilisés pendant trois mois.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.