Llama 3.2 3B Instruct

Publié par Meta le 25 septembre 2024, Llama 3.2 3B Instruct est un LLM de 3 milliards de paramètres destiné au suivi d’instructions. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances apparaissent largement dépassées.

Publié par Meta le 25 septembre 2024, Llama 3.2 3B Instruct est un LLM de 3 milliards de paramètres destiné au suivi d’instructions. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances apparaissent largement dépassées.

Le modèle conserve deux caractéristiques notables : une fenêtre de contexte de 131 072 tokens et un accès gratuit, soit un tarif 100% inférieur à la moyenne des LLM similaires. Ses connaissances s’arrêtent au 31 décembre 2023. Il est distribué sous Llama 3.2 Community License, avec des poids non ouverts.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
LicenceLlama 3.2 Community License
Date de sortie25 septembre 2024
Multimodalnon
Paramètres3 milliards
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
ARC-C78,6 %17ᵉ / 34llm-statsAuto-déclaré
GSM8k77,7 %39ᵉ / 47llm-statsAuto-déclaré
IFEval77,4 %56ᵉ / 65llm-statsAuto-déclaré
HellaSwag69,8 %24ᵉ / 27llm-statsAuto-déclaré
BFCL v267,0 %4ᵉ / 5llm-statsAuto-déclaré
MMLU63,4 %94ᵉ / 98llm-statsAuto-déclaré
MGSM58,2 %26ᵉ / 30llm-statsAuto-déclaré
MATH48,0 %58ᵉ / 70llm-statsAuto-déclaré
Nexus34,3 %4ᵉ / 4llm-statsAuto-déclaré
GPQA32,8 %203ᵉ / 219llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Venicegratuitgratuitn.d.
Parasail0,05 $0,33 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0 $
Latence moyenne par benchmark — Benchable4 min 23 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Le meilleur résultat observé concerne Email Classification, domaine dans lequel le modèle affiche une efficacité nettement supérieure à ses autres évaluations. Hallucinations et General Knowledge constituent ses deux autres points relativement solides, même si leurs classements restent bas face aux modèles évalués. Sa fenêtre de contexte de 131 072 tokens offre une capacité d’entrée importante pour un modèle de 3 milliards de paramètres. Son principal avantage pratique reste économique : l’entrée et la sortie sont gratuites, un positionnement très inférieur au coût moyen des LLM similaires. À sa sortie, il figurait dans le top 82% des 34 LLM de sa génération sur GPQA.

Limites et points d’attention. Les résultats montrent de fortes faiblesses en Instruction Following et en Reasoning, avec des positions proches du bas des classements. Ethics est également peu convaincant. Même ses meilleurs scores se traduisent par des rangs faibles, ce qui limite son intérêt face à des solutions plus performantes. Son ancienneté d’environ deux ans est très importante dans ce secteur : ses performances sont aujourd’hui largement dépassées, et les modèles de cette période sont souvent retirés des catalogues des éditeurs. La limite de connaissances fixée à fin 2023 accentue ce vieillissement.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).