Llama 3.3 70B Instruct

Publié par Meta le 6 décembre 2024, Llama 3.3 70B Instruct est un LLM de 70 milliards de paramètres désormais ancien à l’échelle de l’IA. À sa sortie, il se classait dans le top 36% des modèles de sa génération sur GPQA, un positionnement solide pour sa période.

Publié par Meta le 6 décembre 2024, Llama 3.3 70B Instruct est un LLM de 70 milliards de paramètres désormais ancien à l’échelle de l’IA. À sa sortie, il se classait dans le top 36% des modèles de sa génération sur GPQA, un positionnement solide pour sa période.

Sa fenêtre de contexte atteint 131 072 tokens, tandis que ses connaissances s’arrêtent au 31 décembre 2023. Référencé comme gratuit en entrée et en sortie, son tarif se situe 100% sous la moyenne des LLM similaires. Ses poids restent soumis à la Llama 3.3 Community License Agreement et ne sont pas ouverts.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
LicenceLlama 3.3 Community License Agreement
Date de sortie6 décembre 2024
Multimodalnon
Paramètres70 milliards
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index9.4130ᵉ / 137
Code Index11.971ᵉ / 74
Agentic Index0.367ᵉ / 68
Math Index7.750ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
IFEval92,1 %9ᵉ / 65llm-statsAuto-déclaré
MGSM91,1 %4ᵉ / 30llm-statsAuto-déclaré
HumanEval88,4 %20ᵉ / 65llm-statsAuto-déclaré
MMLU86,0 %31ᵉ / 98llm-statsAuto-déclaré
BFCL v277,3 %1ᵉ / 5llm-statsAuto-déclaré
MATH77,0 %23ᵉ / 70llm-statsAuto-déclaré
MMLU-Pro68,9 %83ᵉ / 125llm-statsAuto-déclaré
GPQA50,5 %161ᵉ / 219llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Llama 3.3 70B Instruct9.4

Code Index

▶ Llama 3.3 70B Instruct11.9

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Venicegratuitgratuitn.d.
DeepInfra (Turbo)0,1 $0,32 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0 $
Latence moyenne par benchmark — Benchable5 min 00 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Llama 3.3 70B Instruct se distingue surtout sur Email Classification, où il obtient un score parfait et figure dans le top 10. Les résultats bruts sont également élevés en Ethics, General Knowledge et Hallucinations, même si leurs classements relatifs sont moins remarquables. À son lancement, son classement dans le top 36% sur GPQA le plaçait dans la partie haute des LLM sortis au cours des quelque 18 mois précédents. Sa longue fenêtre de contexte constitue un autre trait notable, tout comme son positionnement tarifaire très économique.

Limites et points d’attention. Près de deux ans après sa sortie, ses performances sont largement dépassées à l’échelle du secteur, et les modèles de cet âge sont souvent retirés des catalogues de leur éditeur. Ses Intelligence Index, Code Index, Agentic Index et Math Index se situent tous près du bas de leurs classements respectifs. Les résultats en Mathematics et Instruction Following restent modestes, avec seulement 64% et 62% sur les évaluations Baseline. Les scores bruts élevés de plusieurs tests doivent aussi être relativisés par des rangs de milieu ou de bas de tableau. Enfin, la coupure des connaissances à fin 2023 limite la couverture des événements ultérieurs.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Benchable.ai (benchable.ai).