Llama 3.1 405B Instruct

Sorti le 23 juillet 2024, Llama 3.1 405B Instruct est déjà ancien à l’échelle de l’IA. Ce LLM de Meta appartient désormais à une génération probablement dépassée par les modèles haut de gamme plus récents.

Sorti le 23 juillet 2024, Llama 3.1 405B Instruct est déjà ancien à l’échelle de l’IA. Ce LLM de Meta appartient désormais à une génération probablement dépassée par les modèles haut de gamme plus récents.

Ses 405 milliards de paramètres et sa fenêtre de contexte de 131 072 tokens en font néanmoins un modèle particulièrement imposant. Ses connaissances s’arrêtent au 31 décembre 2023. Il est distribué sous la Llama 3.1 Community License, avec des poids qui ne sont pas ouverts.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
LicenceLlama 3.1 Community License
Date de sortie23 juillet 2024
Multimodalnon
Paramètres405 milliards
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
ARC-C96,9 %2ᵉ / 34llm-statsAuto-déclaré
GSM8k96,8 %5ᵉ / 47llm-statsAuto-déclaré
API-Bank92,0 %1ᵉ / 3llm-statsAuto-déclaré
Multilingual MGSM (CoT)91,6 %1ᵉ / 3llm-statsAuto-déclaré
HumanEval89,0 %15ᵉ / 65llm-statsAuto-déclaré
IFEval88,6 %25ᵉ / 65llm-statsAuto-déclaré
MMLU (CoT)88,6 %1ᵉ / 3llm-statsAuto-déclaré
BFCL88,5 %1ᵉ / 11llm-statsAuto-déclaré
MMLU87,3 %24ᵉ / 98llm-statsAuto-déclaré
DROP84,8 %6ᵉ / 29llm-statsAuto-déclaré
Multipl-E HumanEval75,2 %1ᵉ / 3llm-statsAuto-déclaré
MATH73,8 %30ᵉ / 70llm-statsAuto-déclaré
MMLU-Pro73,3 %73ᵉ / 125llm-statsAuto-déclaré
Multipl-E MBPP65,7 %1ᵉ / 3llm-statsAuto-déclaré
Nexus58,7 %1ᵉ / 4llm-statsAuto-déclaré
GPQA50,7 %160ᵉ / 219llm-statsAuto-déclaré
Gorilla Benchmark API Bench35,3 %1ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. À sa sortie, Llama 3.1 405B Instruct se situait dans le haut du classement de sa génération sur GPQA, parmi le top 28 % des 25 LLM publiés au cours des quelque 18 mois précédents. Ce résultat le plaçait parmi les modèles solides de son époque sur ce benchmark. Sa fenêtre de 131 072 tokens constituait également une caractéristique notable, adaptée au traitement de volumes de texte importants dans une même séquence. Le modèle associait ainsi une très grande taille, avec 405 milliards de paramètres, à un contexte étendu.

Limites et points d’attention. Près de deux ans après sa sortie, ses performances sont probablement largement dépassées par celles des modèles haut de gamme récents. Cette ancienneté est très importante dans un secteur qui évolue rapidement, et les modèles de cette période sont souvent retirés des catalogues de leurs éditeurs. La date limite des connaissances, fixée au 31 décembre 2023, réduit aussi la pertinence des réponses portant sur des événements ultérieurs. Enfin, la Llama 3.1 Community License ne correspond pas à une publication avec des poids ouverts, ce qui encadre l’accès et les possibilités de réutilisation.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).