Llama 3.2 3B Instruct
Publié par Meta le 25 septembre 2024, Llama 3.2 3B Instruct est un LLM de 3 milliards de paramètres destiné au suivi d’instructions. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances apparaissent largement dépassées.
Publié par Meta le 25 septembre 2024, Llama 3.2 3B Instruct est un LLM de 3 milliards de paramètres destiné au suivi d’instructions. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances apparaissent largement dépassées.
Le modèle conserve deux caractéristiques notables : une fenêtre de contexte de 131 072 tokens et un accès gratuit, soit un tarif 100% inférieur à la moyenne des LLM similaires. Ses connaissances s’arrêtent au 31 décembre 2023. Il est distribué sous Llama 3.2 Community License, avec des poids non ouverts.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts · usage commercial restreint (recherche / non commercial) |
| Licence | Llama 3.2 Community License |
| Date de sortie | 25 septembre 2024 |
| Multimodal | non |
| Paramètres | 3 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| ARC-C | 78,6 % | 17ᵉ / 34 | llm-stats | Auto-déclaré |
| GSM8k | 77,7 % | 39ᵉ / 47 | llm-stats | Auto-déclaré |
| IFEval | 77,4 % | 56ᵉ / 65 | llm-stats | Auto-déclaré |
| HellaSwag | 69,8 % | 24ᵉ / 27 | llm-stats | Auto-déclaré |
| BFCL v2 | 67,0 % | 4ᵉ / 5 | llm-stats | Auto-déclaré |
| MMLU | 63,4 % | 94ᵉ / 98 | llm-stats | Auto-déclaré |
| MGSM | 58,2 % | 26ᵉ / 30 | llm-stats | Auto-déclaré |
| MATH | 48,0 % | 58ᵉ / 70 | llm-stats | Auto-déclaré |
| Nexus | 34,3 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| GPQA | 32,8 % | 203ᵉ / 219 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Venice | gratuit | gratuit | n.d. |
| Parasail | 0,05 $ | 0,33 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 4 min 23 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Le meilleur résultat observé concerne Email Classification, domaine dans lequel le modèle affiche une efficacité nettement supérieure à ses autres évaluations. Hallucinations et General Knowledge constituent ses deux autres points relativement solides, même si leurs classements restent bas face aux modèles évalués. Sa fenêtre de contexte de 131 072 tokens offre une capacité d’entrée importante pour un modèle de 3 milliards de paramètres. Son principal avantage pratique reste économique : l’entrée et la sortie sont gratuites, un positionnement très inférieur au coût moyen des LLM similaires. À sa sortie, il figurait dans le top 82% des 34 LLM de sa génération sur GPQA.
Limites et points d’attention. Les résultats montrent de fortes faiblesses en Instruction Following et en Reasoning, avec des positions proches du bas des classements. Ethics est également peu convaincant. Même ses meilleurs scores se traduisent par des rangs faibles, ce qui limite son intérêt face à des solutions plus performantes. Son ancienneté d’environ deux ans est très importante dans ce secteur : ses performances sont aujourd’hui largement dépassées, et les modèles de cette période sont souvent retirés des catalogues des éditeurs. La limite de connaissances fixée à fin 2023 accentue ce vieillissement.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).