Llama 3.1-405B

Publié par Meta aux États-Unis le 23 juillet 2024, Llama 3.1-405B est un LLM de 405 milliards de paramètres. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances sont probablement dépassées par celles des modèles plus…

Publié par Meta aux États-Unis le 23 juillet 2024, Llama 3.1-405B est un LLM de 405 milliards de paramètres. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances sont probablement dépassées par celles des modèles plus récents.

Son entraînement reste particulièrement marquant : 3,8 × 10²⁵ FLOP, soit environ 10,6 millions d’heures-GPU H100, l’équivalent de quelque 4 900 GPU H100 mobilisés pendant trois mois. Son coût d’entraînement est estimé à 52,9 millions de dollars de 2023.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids▫ n.d.
Date de sortie23 juillet 2024
Paramètres405 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond50,9 %41ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 549,8 %27ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20259,7 %39ᵉ / 64epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

▶ Llama 3.1-405B51 %
Tulu 346 %

Epoch: MATH level 5

GPT-598 %
▶ Llama 3.1-405B50 %
Tulu 343 %

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement3,8 × 10²⁵ FLOP
Taille du jeu d'entraînement1,6 × 10¹³
Jeu de donnéesLlama 3 dataset
Coût d'entraînement estimé≈ 52 885 434 $ (USD 2023)
MatérielNVIDIA H100 SXM5 80GB
Nombre de puces16 384
Puissance électrique22 622 532 W
Durée d'entraînement2 142 h
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Llama 3.1-405B figurait dans le top 10% sur GPQA diamond parmi les 39 LLM de sa génération. Ce résultat le plaçait alors dans le haut du panier pour les questions scientifiques de niveau doctorat. Ses résultats sur MATH level 5 montrent aussi une capacité notable à traiter des problèmes mathématiques difficiles, même si son classement actuel se situe plutôt au milieu du tableau. L’ampleur de ses 405 milliards de paramètres et de son calcul d’entraînement en faisait un modèle particulièrement ambitieux pour juillet 2024.

Limites et points d’attention. Son score sur OTIS Mock AIME 2024-2025 le situe dans le bas du classement pour les problèmes d’olympiades mathématiques de niveau lycée. Sur GPQA diamond, son rang actuel est également nettement moins favorable que son positionnement à sa sortie, signe du rythme rapide des progrès du secteur. Près de deux ans constituent une ancienneté très longue pour un LLM : ses performances sont aujourd’hui probablement largement dépassées et les modèles de cette période sont souvent retirés du catalogue de leur éditeur. L’effort industriel demeure toutefois remarquable, avec environ 4 900 GPU H100 pendant trois mois et un coût estimé à 52,9 millions de dollars.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.