GPT-5.4
GPT-5.4 est un LLM propriétaire d’OpenAI, lancé le 5 mars 2026 par l’éditeur américain. Sa caractéristique la plus marquante est sa fenêtre de contexte de 1 050 000 tokens, soit environ 1,1 million, adaptée au traitement de très grands volumes de texte.
GPT-5.4 est un LLM propriétaire d’OpenAI, lancé le 5 mars 2026 par l’éditeur américain. Sa caractéristique la plus marquante est sa fenêtre de contexte de 1 050 000 tokens, soit environ 1,1 million, adaptée au traitement de très grands volumes de texte.
À sa sortie, il se situait dans le haut du panier de sa génération, avec un profil particulièrement solide en mathématiques. Son positionnement tarifaire reste économique face aux modèles frontière, malgré un prix supérieur à la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 5 mars 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 1 050 000 tokens (≈ 1,1 M) |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 239 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 258 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 257 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 23ᵉ / 263 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 95,3 % | 18ᵉ / 119 | epoch | ✅ Mesuré |
| LiveBench: Mathematics | 94,1 % | 4ᵉ / 26 | livebench | ✅ Mesuré |
| Epoch: GPQA diamond | 93,3 % | 9ᵉ / 140 | epoch | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 90,0 % | 98ᵉ / 249 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 89,0 % | 130ᵉ / 230 | benchable | ✅ Mesuré |
| LiveBench: Reasoning | 88,1 % | 5ᵉ / 26 | livebench | ✅ Mesuré |
| Benchable : Coding (Baseline) | 88,0 % | 140ᵉ / 259 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 83,0 % | 38ᵉ / 261 | benchable | ✅ Mesuré |
| LiveBench: Language | 82,6 % | 6ᵉ / 26 | livebench | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 80,0 % | 6ᵉ / 64 | epoch | ✅ Mesuré |
| LiveBench: Data Analysis | 79,3 % | 2ᵉ / 26 | livebench | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 78,6 % | 10ᵉ / 39 | epoch | ✅ Mesuré |
| LiveBench: Global average | 78,0 % | 4ᵉ / 26 | livebench | ✅ Mesuré |
| LiveBench: Coding | 77,5 % | 14ᵉ / 26 | livebench | ✅ Mesuré |
| Epoch: SWE-Bench verified | 76,9 % | 8ᵉ / 32 | epoch | ✅ Mesuré |
| PinchBench : agentique (OpenClaw, 147 tâches) | 75,7 % | 21ᵉ / 57 | pinchbench | ✅ Mesuré |
| LiveBench: IF | 70,2 % | 7ᵉ / 26 | livebench | ✅ Mesuré |
| LiveBench: Agentic Coding | 53,8 % | 2ᵉ / 26 | livebench | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Public | 50,0 % | 2ᵉ / 36 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 49,0 % | 11ᵉ / 40 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 47,6 % | 4ᵉ / 69 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 44,8 % | 26ᵉ / 60 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 44,0 % | 9ᵉ / 52 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 27,1 % | 7ᵉ / 55 | epoch | ✅ Mesuré |
| Epoch: EBR-bench | 25,4 % | 4ᵉ / 17 | epoch | ✅ Mesuré |
| Tau2 Telecom | 98,9 % | 3ᵉ / 34 | llm-stats | Auto-déclaré |
| ARC-AGI | 93,7 % | 2ᵉ / 7 | llm-stats | Auto-déclaré |
| Graphwalks BFS <128k | 93,0 % | 2ᵉ / 11 | llm-stats | Auto-déclaré |
| GPQA | 92,8 % | 11ᵉ / 220 | llm-stats | Auto-déclaré |
| Graphwalks parents <128k | 89,8 % | 1ᵉ / 11 | llm-stats | Auto-déclaré |
| OmniDocBench 1.5 | 89,1 % | 7ᵉ / 13 | llm-stats | Auto-déclaré |
| BrowseComp | 82,7 % | 19ᵉ / 58 | llm-stats | Auto-déclaré |
| MMMU-Pro | 81,2 % | 7ᵉ / 64 | llm-stats | Auto-déclaré |
| LiveBench | 80,3 % | 3ᵉ / 38 | llm-stats | n.d. |
| Terminal-Bench 2.0 | 75,1 % | 6ᵉ / 49 | llm-stats | Auto-déclaré |
| OSWorld-Verified | 75,0 % | 10ᵉ / 21 | llm-stats | Auto-déclaré |
| ARC-AGI v2 | 73,3 % | 3ᵉ / 16 | llm-stats | Auto-déclaré |
| MCP Atlas | 67,2 % | 21ᵉ / 30 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 57,7 % | 19ᵉ / 43 | llm-stats | Auto-déclaré |
| Finance Agent | 56,0 % | 6ᵉ / 8 | llm-stats | Auto-déclaré |
| Toolathlon | 54,6 % | 7ᵉ / 30 | llm-stats | Auto-déclaré |
| FrontierSWE | 54,0 % | 8ᵉ / 14 | llm-stats | n.d. |
| DeepSWE 1.1 | 52,0 % | 12ᵉ / 18 | llm-stats | n.d. |
| GDPval-AA | 47,6 % | 13ᵉ / 42 | llm-stats | n.d. |
| FrontierMath | 47,6 % | 4ᵉ / 16 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 39,8 % | 34ᵉ / 90 | llm-stats | Auto-déclaré |
| Graphwalks parents >128k | 32,4 % | 4ᵉ / 7 | llm-stats | Auto-déclaré |
| Graphwalks BFS >128k | 21,4 % | 8ᵉ / 11 | llm-stats | Auto-déclaré |
| Legal Agent Benchmark | 0,4 % | 9ᵉ / 13 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Hallucinations (Baseline)
Benchable : General Knowledge (Baseline)
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1478 | 15ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Document | 1470 | 11ᵉ / 32 | Claude Opus 4.6 (1510) |
| Arena Text | 1466 | 35ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Code | 1462 | 32ᵉ / 101 | Kimi K3 (1682) |
| Arena Code | 1444 | 37ᵉ / 101 | Kimi K3 (1682) |
| Arena Image-to-Code | 1435 | 23ᵉ / 32 | Claude Fable 5 (1636) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| openai | 2,5 $ | 15 $ | n.d. |
| OpenAI | 2,5 $ | 15 $ | 0,25 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 20 % au-dessus de la moyenne des LLM similaires, et 2,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 18,67 $ |
| Durée d'exécution — PinchBench | 4 h 32 min |
| Indice valeur/coût — PinchBench | 8,51 |
| Coût moyen par benchmark — Benchable | 0,09 $ |
| Latence moyenne par benchmark — Benchable | 1 min 49 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, GPT-5.4 figurait dans le top 4 % des 81 LLM de sa génération sur GPQA diamond. Il atteint aussi le top 10 de LiveBench Mathematics et obtient un résultat élevé sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée. Sa fenêtre de 1 050 000 tokens constitue un autre atout concret. Le modèle coûte environ 2,2 fois moins cher que les modèles frontière.
Limites et points d’attention. Dans Arena text, deux classements le placent aux 15e et 35e rangs sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Dans Arena document, il occupe le 11e rang sur 32, derrière Claude Opus 4.6 et Claude Fable 5. Dans les trois cas, GPT-5.4 et le premier restent proches en préférence humaine. Ses scores Benchable sont plafonnés ou presque et partagés par de nombreux modèles, ce qui limite leur portée comparative. Son tarif dépasse de 20 % la moyenne des LLM similaires. GPT-5.4 reste pertinent pour les mathématiques et les usages exigeant une très grande fenêtre de contexte. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · LiveBench (livebench.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).