GPT-5.4 mini
GPT-5.4 mini est un LLM propriétaire d’OpenAI, lancé le 17 mars 2026. Son positionnement associe une fenêtre de contexte très étendue de 400 000 tokens à un tarif très économique, inférieur de 62% à la moyenne des modèles similaires.
GPT-5.4 mini est un LLM propriétaire d’OpenAI, lancé le 17 mars 2026. Son positionnement associe une fenêtre de contexte très étendue de 400 000 tokens à un tarif très économique, inférieur de 62% à la moyenne des modèles similaires.
Ses connaissances s’arrêtent au 31 août 2025. À sa sortie, GPT-5.4 mini se classait dans le top 33% des LLM de sa génération sur GPQA diamond, tout en coûtant environ 7,3 fois moins cher que les modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 17 mars 2026 |
| Connaissances jusqu'à | 2025-08-31 |
| Multimodal | oui |
| Fenêtre de contexte | 400 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 16.6 | 111ᵉ / 137 |
| Code Index | 56.1 | 24ᵉ / 74 |
| Agentic Index | 30.2 | 20ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Tau2 Telecom | 93,4 % | 12ᵉ / 34 | llm-stats | Auto-déclaré |
| GPQA | 88,0 % | 31ᵉ / 219 | llm-stats | Auto-déclaré |
| OmniDocBench 1.5 | 87,4 % | 11ᵉ / 13 | llm-stats | Auto-déclaré |
| MMMU-Pro | 76,6 % | 26ᵉ / 64 | llm-stats | Auto-déclaré |
| Graphwalks BFS <128k | 76,3 % | 3ᵉ / 10 | llm-stats | Auto-déclaré |
| OSWorld-Verified | 72,1 % | 12ᵉ / 19 | llm-stats | Auto-déclaré |
| Graphwalks parents <128k | 71,5 % | 4ᵉ / 10 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 60,0 % | 20ᵉ / 49 | llm-stats | Auto-déclaré |
| MCP Atlas | 57,7 % | 27ᵉ / 30 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 54,4 % | 31ᵉ / 41 | llm-stats | Auto-déclaré |
| Finance Agent v2 | 45,4 % | 10ᵉ / 26 | llm-stats | n.d. |
| Toolathlon | 42,9 % | 22ᵉ / 30 | llm-stats | Auto-déclaré |
| GDPval-AA | 39,7 % | 23ᵉ / 39 | llm-stats | n.d. |
| MRCR v2 (8-needle) | 33,6 % | 10ᵉ / 19 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 28,2 % | 44ᵉ / 89 | llm-stats | Auto-déclaré |
| Legal Agent Benchmark | 0,0 % | 9ᵉ / 12 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 49ᵉ | GPT-5.1 | 1455 |
| 50ᵉ | Gemma 4 31B | 1451 |
| 51ᵉ | GPT-5.4 mini | 1450 |
| 52ᵉ | Kimi K2.5 | 1450 |
| 53ᵉ | Claude Opus 4.1 | 1449 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 45ᵉ | GPT-5.3 Codex | 1406 |
| 46ᵉ | GPT-5.2 | 1406 |
| 47ᵉ | GPT-5.4 mini | 1398 |
| 48ᵉ | Qwen3.5-397B-A17B | 1396 |
| 49ᵉ | MiniMax M2.7 | 1395 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 25ᵉ | Qwen3.7-Plus | 1257 |
| 26ᵉ | Gemma 4 31B | 1255 |
| 27ᵉ | GPT-5.4 mini | 1254 |
| 28ᵉ | Grok-4.20 Beta | 1253 |
| 29ᵉ | Grok-4.20 Multi-Agent Beta | 1250 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 0,75 $ | 4,5 $ | 0,075 $ |
| openai | 0,75 $ | 4,5 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 64 % en dessous de la moyenne des LLM similaires, et 7,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 4,87 $ |
| Durée d'exécution — PinchBench | 3 h 19 min |
| Indice valeur/coût — PinchBench | 25,38 |
| Coût moyen par benchmark — Benchable | 0,03 $ |
| Latence moyenne par benchmark — Benchable | 1 min 23 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. GPT-5.4 mini obtient un résultat parfait sur Ethics (Baseline), à la première place du classement. Ses scores sont également élevés en connaissances générales, classification d’e-mails et maîtrise des hallucinations. OTIS Mock AIME 2024-2025 confirme de bonnes aptitudes en olympiades de mathématiques de niveau lycée. Le Code Index et l’Agentic Index le situent dans le premier tiers de leurs classements respectifs. Les évaluations Arena placent aussi sa vision dans le premier cinquième, tandis que le texte se situe dans le premier quart. Sa fenêtre de 400 000 tokens constitue un autre trait distinctif.
Limites et points d’attention. L’Intelligence Index se situe près du bas du classement, en décalage avec les bons résultats spécialisés. Les performances en programmation sont irrégulières : le Code Index est favorable, mais Coding (Baseline) et Arena code affichent des classements nettement moins convaincants. Arena text reste à distance du modèle en tête, et l’écart est encore plus marqué en code. Les poids ne sont pas ouverts, la licence étant propriétaire. Le modèle convient surtout aux usages sensibles au coût, aux contextes très longs, à la classification, aux connaissances générales et aux tâches mathématiques de niveau lycée, avec davantage de prudence pour le raisonnement général et le code exigeant.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).