Llama 3.3 70B Instruct
Publié par Meta le 6 décembre 2024, Llama 3.3 70B Instruct est un LLM de 70 milliards de paramètres désormais ancien à l’échelle de l’IA. À sa sortie, il se classait dans le top 36% des modèles de sa génération sur GPQA, un positionnement solide pour sa période.
Publié par Meta le 6 décembre 2024, Llama 3.3 70B Instruct est un LLM de 70 milliards de paramètres désormais ancien à l’échelle de l’IA. À sa sortie, il se classait dans le top 36% des modèles de sa génération sur GPQA, un positionnement solide pour sa période.
Sa fenêtre de contexte atteint 131 072 tokens, tandis que ses connaissances s’arrêtent au 31 décembre 2023. Référencé comme gratuit en entrée et en sortie, son tarif se situe 100% sous la moyenne des LLM similaires. Ses poids restent soumis à la Llama 3.3 Community License Agreement et ne sont pas ouverts.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts · usage commercial restreint (recherche / non commercial) |
| Licence | Llama 3.3 Community License Agreement |
| Date de sortie | 6 décembre 2024 |
| Multimodal | non |
| Paramètres | 70 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 9.4 | 130ᵉ / 137 |
| Code Index | 11.9 | 71ᵉ / 74 |
| Agentic Index | 0.3 | 67ᵉ / 68 |
| Math Index | 7.7 | 50ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| IFEval | 92,1 % | 9ᵉ / 65 | llm-stats | Auto-déclaré |
| MGSM | 91,1 % | 4ᵉ / 30 | llm-stats | Auto-déclaré |
| HumanEval | 88,4 % | 20ᵉ / 65 | llm-stats | Auto-déclaré |
| MMLU | 86,0 % | 31ᵉ / 98 | llm-stats | Auto-déclaré |
| BFCL v2 | 77,3 % | 1ᵉ / 5 | llm-stats | Auto-déclaré |
| MATH | 77,0 % | 23ᵉ / 70 | llm-stats | Auto-déclaré |
| MMLU-Pro | 68,9 % | 83ᵉ / 125 | llm-stats | Auto-déclaré |
| GPQA | 50,5 % | 161ᵉ / 219 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Venice | gratuit | gratuit | n.d. |
| DeepInfra (Turbo) | 0,1 $ | 0,32 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 5 min 00 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Llama 3.3 70B Instruct se distingue surtout sur Email Classification, où il obtient un score parfait et figure dans le top 10. Les résultats bruts sont également élevés en Ethics, General Knowledge et Hallucinations, même si leurs classements relatifs sont moins remarquables. À son lancement, son classement dans le top 36% sur GPQA le plaçait dans la partie haute des LLM sortis au cours des quelque 18 mois précédents. Sa longue fenêtre de contexte constitue un autre trait notable, tout comme son positionnement tarifaire très économique.
Limites et points d’attention. Près de deux ans après sa sortie, ses performances sont largement dépassées à l’échelle du secteur, et les modèles de cet âge sont souvent retirés des catalogues de leur éditeur. Ses Intelligence Index, Code Index, Agentic Index et Math Index se situent tous près du bas de leurs classements respectifs. Les résultats en Mathematics et Instruction Following restent modestes, avec seulement 64% et 62% sur les évaluations Baseline. Les scores bruts élevés de plusieurs tests doivent aussi être relativisés par des rangs de milieu ou de bas de tableau. Enfin, la coupure des connaissances à fin 2023 limite la couverture des événements ultérieurs.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Benchable.ai (benchable.ai).