GPT-5.4 mini

GPT-5.4 mini est un LLM propriétaire d’OpenAI, lancé le 17 mars 2026. Son positionnement associe une fenêtre de contexte très étendue de 400 000 tokens à un tarif très économique, inférieur de 62% à la moyenne des modèles similaires.

GPT-5.4 mini est un LLM propriétaire d’OpenAI, lancé le 17 mars 2026. Son positionnement associe une fenêtre de contexte très étendue de 400 000 tokens à un tarif très économique, inférieur de 62% à la moyenne des modèles similaires.

Ses connaissances s’arrêtent au 31 août 2025. À sa sortie, GPT-5.4 mini se classait dans le top 33% des LLM de sa génération sur GPQA diamond, tout en coûtant environ 7,3 fois moins cher que les modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie17 mars 2026
Connaissances jusqu'à2025-08-31
Multimodaloui
Fenêtre de contexte400 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index16.6111ᵉ / 137
Code Index56.124ᵉ / 74
Agentic Index30.220ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Tau2 Telecom93,4 %12ᵉ / 34llm-statsAuto-déclaré
GPQA88,0 %31ᵉ / 219llm-statsAuto-déclaré
OmniDocBench 1.587,4 %11ᵉ / 13llm-statsAuto-déclaré
MMMU-Pro76,6 %26ᵉ / 64llm-statsAuto-déclaré
Graphwalks BFS <128k76,3 %3ᵉ / 10llm-statsAuto-déclaré
OSWorld-Verified72,1 %12ᵉ / 19llm-statsAuto-déclaré
Graphwalks parents <128k71,5 %4ᵉ / 10llm-statsAuto-déclaré
Terminal-Bench 2.060,0 %20ᵉ / 49llm-statsAuto-déclaré
MCP Atlas57,7 %27ᵉ / 30llm-statsAuto-déclaré
SWE-Bench Pro54,4 %31ᵉ / 41llm-statsAuto-déclaré
Finance Agent v245,4 %10ᵉ / 26llm-statsn.d.
Toolathlon42,9 %22ᵉ / 30llm-statsAuto-déclaré
GDPval-AA39,7 %23ᵉ / 39llm-statsn.d.
MRCR v2 (8-needle)33,6 %10ᵉ / 19llm-statsAuto-déclaré
Humanity's Last Exam28,2 %44ᵉ / 89llm-statsAuto-déclaré
Legal Agent Benchmark0,0 %9ᵉ / 12llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nova 2.0 Pro Preview21.8
▶ GPT-5.4 mini16.6

Code Index

▶ GPT-5.4 mini56.1
Grok Build 0.1 061651.5

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
49ᵉGPT-5.11455
50ᵉGemma 4 31B1451
51ᵉGPT-5.4 mini1450
52ᵉKimi K2.51450
53ᵉClaude Opus 4.11449

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
45ᵉGPT-5.3 Codex1406
46ᵉGPT-5.21406
47ᵉGPT-5.4 mini1398
48ᵉQwen3.5-397B-A17B1396
49ᵉMiniMax M2.71395

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
25ᵉQwen3.7-Plus1257
26ᵉGemma 4 31B1255
27ᵉGPT-5.4 mini1254
28ᵉGrok-4.20 Beta1253
29ᵉGrok-4.20 Multi-Agent Beta1250

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI0,75 $4,5 $0,075 $
openai0,75 $4,5 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 64 % en dessous de la moyenne des LLM similaires, et 7,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)4,87 $
Durée d'exécution — PinchBench3 h 19 min
Indice valeur/coût — PinchBench25,38
Coût moyen par benchmark — Benchable0,03 $
Latence moyenne par benchmark — Benchable1 min 23 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. GPT-5.4 mini obtient un résultat parfait sur Ethics (Baseline), à la première place du classement. Ses scores sont également élevés en connaissances générales, classification d’e-mails et maîtrise des hallucinations. OTIS Mock AIME 2024-2025 confirme de bonnes aptitudes en olympiades de mathématiques de niveau lycée. Le Code Index et l’Agentic Index le situent dans le premier tiers de leurs classements respectifs. Les évaluations Arena placent aussi sa vision dans le premier cinquième, tandis que le texte se situe dans le premier quart. Sa fenêtre de 400 000 tokens constitue un autre trait distinctif.

Limites et points d’attention. L’Intelligence Index se situe près du bas du classement, en décalage avec les bons résultats spécialisés. Les performances en programmation sont irrégulières : le Code Index est favorable, mais Coding (Baseline) et Arena code affichent des classements nettement moins convaincants. Arena text reste à distance du modèle en tête, et l’écart est encore plus marqué en code. Les poids ne sont pas ouverts, la licence étant propriétaire. Le modèle convient surtout aux usages sensibles au coût, aux contextes très longs, à la classification, aux connaissances générales et aux tâches mathématiques de niveau lycée, avec davantage de prudence pour le raisonnement général et le code exigeant.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).