Llama 4 Maverick
Publié par Meta le 5 avril 2025, Llama 4 Maverick est déjà ancien à l’échelle de l’IA. Environ un an après sa sortie, ses performances sont largement dépassées et le modèle est souvent absent du catalogue de l’éditeur.
Publié par Meta le 5 avril 2025, Llama 4 Maverick est déjà ancien à l’échelle de l’IA. Environ un an après sa sortie, ses performances sont largement dépassées et le modèle est souvent absent du catalogue de l’éditeur.
Ce LLM se distingue par 400 milliards de paramètres, dont 17 milliards actifs, et une fenêtre de contexte d’environ 1,0 million de tokens. Très économique, il est proposé à un tarif inférieur de 92% à la moyenne des LLM similaires. Sa licence Llama 4 Community License Agreement ne rend pas ses poids ouverts.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts · usage commercial restreint (recherche / non commercial) |
| Licence | Llama 4 Community License Agreement |
| Date de sortie | 5 avril 2025 |
| Multimodal | oui |
| Paramètres | 400 milliards |
| Paramètres actifs | 17 milliards |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 14.3 | 116ᵉ / 137 |
| Code Index | 16.3 | 67ᵉ / 74 |
| Agentic Index | 1.3 | 64ᵉ / 68 |
| Math Index | 19.3 | 46ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQA | 94,4 % | 7ᵉ / 26 | llm-stats | Auto-déclaré |
| MGSM | 92,3 % | 1ᵉ / 30 | llm-stats | Auto-déclaré |
| ChartQA | 90,0 % | 2ᵉ / 24 | llm-stats | Auto-déclaré |
| MMLU | 85,5 % | 37ᵉ / 98 | llm-stats | Auto-déclaré |
| MMLU-Pro | 80,5 % | 51ᵉ / 125 | llm-stats | Auto-déclaré |
| MBPP | 77,6 % | 16ᵉ / 33 | llm-stats | Auto-déclaré |
| MathVista | 73,7 % | 8ᵉ / 38 | llm-stats | Auto-déclaré |
| MMMU | 73,4 % | 23ᵉ / 61 | llm-stats | Auto-déclaré |
| GPQA | 69,8 % | 119ᵉ / 219 | llm-stats | Auto-déclaré |
| MATH | 61,2 % | 45ᵉ / 70 | llm-stats | Auto-déclaré |
| MMMU-Pro | 59,6 % | 50ᵉ / 64 | llm-stats | Auto-déclaré |
| LiveCodeBench | 43,4 % | 48ᵉ / 72 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 86ᵉ | mistral-medium-2505 | 1156 |
| 87ᵉ | hunyuan-large-vision | 1149 |
| 88ᵉ | Llama 4 Maverick | 1146 |
| 89ᵉ | GPT-5 nano | 1146 |
| 90ᵉ | step-3 | 1145 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,2 $ | 0,8 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 90 % en dessous de la moyenne des LLM similaires, et 27,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 2,2 × 10²⁴ FLOP |
| Taille du jeu d'entraînement | 3,0 × 10¹³ |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, Llama 4 Maverick se classait dans le top 14% des LLM de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. Son résultat sur MATH level 5 confirmait alors de bonnes aptitudes sur certains problèmes mathématiques exigeants. Sa fenêtre de contexte de 1 048 576 tokens constitue son autre caractéristique majeure. Son positionnement tarifaire reste particulièrement agressif, environ 36,7 fois moins cher que les modèles frontière, avec des prix d’entrée et de sortie très bas.
Limites et points d’attention. Les classements actuels placent le modèle dans le bas du tableau général, ainsi qu’à proximité des dernières places en code et pour les tâches agentiques. Ses résultats en mathématiques de recherche sont presque nuls sur FrontierMath, tandis que ses performances en olympiades de mathématiques restent faibles. La vision se situe également dans la partie basse du classement Arena. Ces performances sont aujourd’hui largement dépassées, et le modèle n’est souvent plus proposé par Meta. Son entraînement demeure marquant par son ampleur, avec 2,2 × 10²⁴ FLOP, soit environ 623 000 heures-GPU H100, l’équivalent de 290 GPU H100 fonctionnant pendant trois mois.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.