Llama 4 Scout
Sorti le 5 avril 2025, Llama 4 Scout est un LLM de Meta qui accuse déjà une ancienneté importante à l’échelle de l’IA. Ses 109 milliards de paramètres et sa fenêtre de contexte de 10 millions de tokens le distinguent, mais ses performances sont désormais probablement dépassées par celles…
Sorti le 5 avril 2025, Llama 4 Scout est un LLM de Meta qui accuse déjà une ancienneté importante à l’échelle de l’IA. Ses 109 milliards de paramètres et sa fenêtre de contexte de 10 millions de tokens le distinguent, mais ses performances sont désormais probablement dépassées par celles de modèles plus récents.
Son principal avantage reste son positionnement très économique, avec une tarification 95% inférieure à la moyenne des LLM similaires et environ 55 fois moins élevée que celle des modèles frontière. Son entraînement a mobilisé 4,1 × 10²⁴ FLOP, soit environ 1,1 million d’heures-GPU H100.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts · usage commercial restreint (recherche / non commercial) |
| Licence | Llama 4 Community License Agreement |
| Date de sortie | 5 avril 2025 |
| Multimodal | oui |
| Paramètres | 109 milliards |
| Fenêtre de contexte | 10 000 000 tokens (≈ 10,0 M) |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQA | 94,4 % | 7ᵉ / 26 | llm-stats | Auto-déclaré |
| MGSM | 90,6 % | 7ᵉ / 30 | llm-stats | Auto-déclaré |
| ChartQA | 88,8 % | 5ᵉ / 24 | llm-stats | Auto-déclaré |
| MMLU | 79,6 % | 62ᵉ / 98 | llm-stats | Auto-déclaré |
| MMLU-Pro | 74,3 % | 70ᵉ / 125 | llm-stats | Auto-déclaré |
| MathVista | 70,7 % | 14ᵉ / 38 | llm-stats | Auto-déclaré |
| MMMU | 69,4 % | 32ᵉ / 61 | llm-stats | Auto-déclaré |
| MBPP | 67,8 % | 24ᵉ / 33 | llm-stats | Auto-déclaré |
| GPQA | 57,2 % | 151ᵉ / 219 | llm-stats | Auto-déclaré |
| MATH | 50,3 % | 54ᵉ / 70 | llm-stats | Auto-déclaré |
| LiveCodeBench | 32,8 % | 58ᵉ / 72 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 93ᵉ | Mistral Small 3.2 24B Instruct | 1140 |
| 94ᵉ | gemini-2.0-flash-lite-preview-02-05 | 1136 |
| 95ᵉ | Llama 4 Scout | 1128 |
| 96ᵉ | Mistral Small 3.1 24B Instruct | 1127 |
| 97ᵉ | Claude 3.5 Haiku | 1127 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,1 $ | 0,3 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 55 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 0,24 $ |
| Durée d'exécution — PinchBench | 3 h 46 min |
| Indice valeur/coût — PinchBench | 13,13 |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 4,1 × 10²⁴ FLOP |
| Taille du jeu d'entraînement | 3,0 × 10¹³ |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, Llama 4 Scout figurait dans le top 34% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Ses résultats sur MATH level 5 le placent davantage en milieu de tableau, mais témoignent de capacités mathématiques générales plus solides que sur les épreuves spécialisées. Sa fenêtre de 10 millions de tokens constitue un trait particulièrement marquant. Son faible tarif favorise par ailleurs les traitements volumineux, avec un coût très inférieur à celui des modèles similaires. L’effort d’entraînement reste notable, équivalant à environ 520 GPU H100 fonctionnant pendant trois mois.
Limites et points d’attention. Les résultats deviennent très faibles lorsque la difficulté augmente. Llama 4 Scout échoue sur les versions publique et privée de FrontierMath, consacrées aux mathématiques de recherche, et reste proche du bas du classement sur l’épreuve d’olympiades OTIS Mock AIME. Il termine dernier sur PinchBench pour les tâches agentiques et se situe dans la partie basse d’Arena vision. Près d’un an après sa sortie, durée très longue dans ce secteur, ses performances sont aujourd’hui largement dépassées. Les modèles de cette ancienneté sont aussi souvent retirés du catalogue de leur éditeur. Enfin, la Llama 4 Community License Agreement s’applique à des poids non ouverts.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com).