Llama 4 Scout

Sorti le 5 avril 2025, Llama 4 Scout est un LLM de Meta qui accuse déjà une ancienneté importante à l’échelle de l’IA. Ses 109 milliards de paramètres et sa fenêtre de contexte de 10 millions de tokens le distinguent, mais ses performances sont désormais probablement dépassées par celles…

Sorti le 5 avril 2025, Llama 4 Scout est un LLM de Meta qui accuse déjà une ancienneté importante à l’échelle de l’IA. Ses 109 milliards de paramètres et sa fenêtre de contexte de 10 millions de tokens le distinguent, mais ses performances sont désormais probablement dépassées par celles de modèles plus récents.

Son principal avantage reste son positionnement très économique, avec une tarification 95% inférieure à la moyenne des LLM similaires et environ 55 fois moins élevée que celle des modèles frontière. Son entraînement a mobilisé 4,1 × 10²⁴ FLOP, soit environ 1,1 million d’heures-GPU H100.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
LicenceLlama 4 Community License Agreement
Date de sortie5 avril 2025
Multimodaloui
Paramètres109 milliards
Fenêtre de contexte10 000 000 tokens (≈ 10,0 M)
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQA94,4 %7ᵉ / 26llm-statsAuto-déclaré
MGSM90,6 %7ᵉ / 30llm-statsAuto-déclaré
ChartQA88,8 %5ᵉ / 24llm-statsAuto-déclaré
MMLU79,6 %62ᵉ / 98llm-statsAuto-déclaré
MMLU-Pro74,3 %70ᵉ / 125llm-statsAuto-déclaré
MathVista70,7 %14ᵉ / 38llm-statsAuto-déclaré
MMMU69,4 %32ᵉ / 61llm-statsAuto-déclaré
MBPP67,8 %24ᵉ / 33llm-statsAuto-déclaré
GPQA57,2 %151ᵉ / 219llm-statsAuto-déclaré
MATH50,3 %54ᵉ / 70llm-statsAuto-déclaré
LiveCodeBench32,8 %58ᵉ / 72llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
93ᵉMistral Small 3.2 24B Instruct1140
94ᵉgemini-2.0-flash-lite-preview-02-051136
95ᵉLlama 4 Scout1128
96ᵉMistral Small 3.1 24B Instruct1127
97ᵉClaude 3.5 Haiku1127

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,1 $0,3 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 55 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)0,24 $
Durée d'exécution — PinchBench3 h 46 min
Indice valeur/coût — PinchBench13,13

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement4,1 × 10²⁴ FLOP
Taille du jeu d'entraînement3,0 × 10¹³
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Llama 4 Scout figurait dans le top 34% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Ses résultats sur MATH level 5 le placent davantage en milieu de tableau, mais témoignent de capacités mathématiques générales plus solides que sur les épreuves spécialisées. Sa fenêtre de 10 millions de tokens constitue un trait particulièrement marquant. Son faible tarif favorise par ailleurs les traitements volumineux, avec un coût très inférieur à celui des modèles similaires. L’effort d’entraînement reste notable, équivalant à environ 520 GPU H100 fonctionnant pendant trois mois.

Limites et points d’attention. Les résultats deviennent très faibles lorsque la difficulté augmente. Llama 4 Scout échoue sur les versions publique et privée de FrontierMath, consacrées aux mathématiques de recherche, et reste proche du bas du classement sur l’épreuve d’olympiades OTIS Mock AIME. Il termine dernier sur PinchBench pour les tâches agentiques et se situe dans la partie basse d’Arena vision. Près d’un an après sa sortie, durée très longue dans ce secteur, ses performances sont aujourd’hui largement dépassées. Les modèles de cette ancienneté sont aussi souvent retirés du catalogue de leur éditeur. Enfin, la Llama 4 Community License Agreement s’applique à des poids non ouverts.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com).