Llama 4 Maverick

Publié par Meta le 5 avril 2025, Llama 4 Maverick est déjà ancien à l’échelle de l’IA. Environ un an après sa sortie, ses performances sont largement dépassées et le modèle est souvent absent du catalogue de l’éditeur.

Publié par Meta le 5 avril 2025, Llama 4 Maverick est déjà ancien à l’échelle de l’IA. Environ un an après sa sortie, ses performances sont largement dépassées et le modèle est souvent absent du catalogue de l’éditeur.

Ce LLM se distingue par 400 milliards de paramètres, dont 17 milliards actifs, et une fenêtre de contexte d’environ 1,0 million de tokens. Très économique, il est proposé à un tarif inférieur de 92% à la moyenne des LLM similaires. Sa licence Llama 4 Community License Agreement ne rend pas ses poids ouverts.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeta
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
LicenceLlama 4 Community License Agreement
Date de sortie5 avril 2025
Multimodaloui
Paramètres400 milliards
Paramètres actifs17 milliards
Fenêtre de contexte1 000 000 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index14.3116ᵉ / 137
Code Index16.367ᵉ / 74
Agentic Index1.364ᵉ / 68
Math Index19.346ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQA94,4 %7ᵉ / 26llm-statsAuto-déclaré
MGSM92,3 %1ᵉ / 30llm-statsAuto-déclaré
ChartQA90,0 %2ᵉ / 24llm-statsAuto-déclaré
MMLU85,5 %37ᵉ / 98llm-statsAuto-déclaré
MMLU-Pro80,5 %51ᵉ / 125llm-statsAuto-déclaré
MBPP77,6 %16ᵉ / 33llm-statsAuto-déclaré
MathVista73,7 %8ᵉ / 38llm-statsAuto-déclaré
MMMU73,4 %23ᵉ / 61llm-statsAuto-déclaré
GPQA69,8 %119ᵉ / 219llm-statsAuto-déclaré
MATH61,2 %45ᵉ / 70llm-statsAuto-déclaré
MMMU-Pro59,6 %50ᵉ / 64llm-statsAuto-déclaré
LiveCodeBench43,4 %48ᵉ / 72llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nova 2.0 Pro Preview21.8
▶ Llama 4 Maverick14.3

Code Index

Nova 2.0 Pro Preview34.0
▶ Llama 4 Maverick16.3

Classements Arena (Elo)

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
86ᵉmistral-medium-25051156
87ᵉhunyuan-large-vision1149
88ᵉLlama 4 Maverick1146
89ᵉGPT-5 nano1146
90ᵉstep-31145

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,2 $0,8 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 90 % en dessous de la moyenne des LLM similaires, et 27,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement2,2 × 10²⁴ FLOP
Taille du jeu d'entraînement3,0 × 10¹³
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Llama 4 Maverick se classait dans le top 14% des LLM de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. Son résultat sur MATH level 5 confirmait alors de bonnes aptitudes sur certains problèmes mathématiques exigeants. Sa fenêtre de contexte de 1 048 576 tokens constitue son autre caractéristique majeure. Son positionnement tarifaire reste particulièrement agressif, environ 36,7 fois moins cher que les modèles frontière, avec des prix d’entrée et de sortie très bas.

Limites et points d’attention. Les classements actuels placent le modèle dans le bas du tableau général, ainsi qu’à proximité des dernières places en code et pour les tâches agentiques. Ses résultats en mathématiques de recherche sont presque nuls sur FrontierMath, tandis que ses performances en olympiades de mathématiques restent faibles. La vision se situe également dans la partie basse du classement Arena. Ces performances sont aujourd’hui largement dépassées, et le modèle n’est souvent plus proposé par Meta. Son entraînement demeure marquant par son ampleur, avec 2,2 × 10²⁴ FLOP, soit environ 623 000 heures-GPU H100, l’équivalent de 290 GPU H100 fonctionnant pendant trois mois.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.