GPT-5.4

GPT-5.4 est un LLM propriétaire d’OpenAI, lancé le 5 mars 2026 par l’éditeur américain. Sa caractéristique la plus marquante est sa fenêtre de contexte de 1 050 000 tokens, soit environ 1,1 million, adaptée au traitement de très grands volumes de texte.

GPT-5.4 est un LLM propriétaire d’OpenAI, lancé le 5 mars 2026 par l’éditeur américain. Sa caractéristique la plus marquante est sa fenêtre de contexte de 1 050 000 tokens, soit environ 1,1 million, adaptée au traitement de très grands volumes de texte.

À sa sortie, il se situait dans le haut du panier de sa génération, avec un profil particulièrement solide en mathématiques. Son positionnement tarifaire reste économique face aux modèles frontière, malgré un prix supérieur à la moyenne des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie5 mars 2026
Multimodaloui
Fenêtre de contexte1 050 000 tokens (≈ 1,1 M)
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 239benchable✅ Mesuré
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 258benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 257benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %23ᵉ / 263benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-202595,3 %18ᵉ / 119epoch✅ Mesuré
LiveBench: Mathematics94,1 %4ᵉ / 26livebench✅ Mesuré
Epoch: GPQA diamond93,3 %9ᵉ / 140epoch✅ Mesuré
Benchable : Reasoning (Baseline)90,0 %98ᵉ / 249benchable✅ Mesuré
Benchable : Mathematics (Baseline)89,0 %130ᵉ / 230benchable✅ Mesuré
LiveBench: Reasoning88,1 %5ᵉ / 26livebench✅ Mesuré
Benchable : Coding (Baseline)88,0 %140ᵉ / 259benchable✅ Mesuré
Benchable : Instruction Following (Baseline)83,0 %38ᵉ / 261benchable✅ Mesuré
LiveBench: Language82,6 %6ᵉ / 26livebench✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public80,0 %6ᵉ / 64epoch✅ Mesuré
LiveBench: Data Analysis79,3 %2ᵉ / 26livebench✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private78,6 %10ᵉ / 39epoch✅ Mesuré
LiveBench: Global average78,0 %4ᵉ / 26livebench✅ Mesuré
LiveBench: Coding77,5 %14ᵉ / 26livebench✅ Mesuré
Epoch: SWE-Bench verified76,9 %8ᵉ / 32epoch✅ Mesuré
PinchBench : agentique (OpenClaw, 147 tâches)75,7 %21ᵉ / 57pinchbench✅ Mesuré
LiveBench: IF70,2 %7ᵉ / 26livebench✅ Mesuré
LiveBench: Agentic Coding53,8 %2ᵉ / 26livebench✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Public50,0 %2ᵉ / 36epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private49,0 %11ᵉ / 40epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private47,6 %4ᵉ / 69epoch✅ Mesuré
Epoch: SimpleQA Verified44,8 %26ᵉ / 60epoch✅ Mesuré
Epoch: Chess Puzzles44,0 %9ᵉ / 52epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private27,1 %7ᵉ / 55epoch✅ Mesuré
Epoch: EBR-bench25,4 %4ᵉ / 17epoch✅ Mesuré
Tau2 Telecom98,9 %3ᵉ / 34llm-statsAuto-déclaré
ARC-AGI93,7 %2ᵉ / 7llm-statsAuto-déclaré
Graphwalks BFS <128k93,0 %2ᵉ / 11llm-statsAuto-déclaré
GPQA92,8 %11ᵉ / 220llm-statsAuto-déclaré
Graphwalks parents <128k89,8 %1ᵉ / 11llm-statsAuto-déclaré
OmniDocBench 1.589,1 %7ᵉ / 13llm-statsAuto-déclaré
BrowseComp82,7 %19ᵉ / 58llm-statsAuto-déclaré
MMMU-Pro81,2 %7ᵉ / 64llm-statsAuto-déclaré
LiveBench80,3 %3ᵉ / 38llm-statsn.d.
Terminal-Bench 2.075,1 %6ᵉ / 49llm-statsAuto-déclaré
OSWorld-Verified75,0 %10ᵉ / 21llm-statsAuto-déclaré
ARC-AGI v273,3 %3ᵉ / 16llm-statsAuto-déclaré
MCP Atlas67,2 %21ᵉ / 30llm-statsAuto-déclaré
SWE-Bench Pro57,7 %19ᵉ / 43llm-statsAuto-déclaré
Finance Agent56,0 %6ᵉ / 8llm-statsAuto-déclaré
Toolathlon54,6 %7ᵉ / 30llm-statsAuto-déclaré
FrontierSWE54,0 %8ᵉ / 14llm-statsn.d.
DeepSWE 1.152,0 %12ᵉ / 18llm-statsn.d.
GDPval-AA47,6 %13ᵉ / 42llm-statsn.d.
FrontierMath47,6 %4ᵉ / 16llm-statsAuto-déclaré
Humanity's Last Exam39,8 %34ᵉ / 90llm-statsAuto-déclaré
Graphwalks parents >128k32,4 %4ᵉ / 7llm-statsAuto-déclaré
Graphwalks BFS >128k21,4 %8ᵉ / 11llm-statsAuto-déclaré
Legal Agent Benchmark0,4 %9ᵉ / 13llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ GPT-5.4100 %

Benchable : General Knowledge (Baseline)

▶ GPT-5.4100 %

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text147815ᵉ / 200Claude Fable 5 (1507)
Arena Document147011ᵉ / 32Claude Opus 4.6 (1510)
Arena Text146635ᵉ / 200Claude Fable 5 (1507)
Arena Code146232ᵉ / 101Kimi K3 (1682)
Arena Code144437ᵉ / 101Kimi K3 (1682)
Arena Image-to-Code143523ᵉ / 32Claude Fable 5 (1636)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
openai2,5 $15 $n.d.
OpenAI2,5 $15 $0,25 $

Prix en dollars US par million de tokens.

Sa tarification se situe 20 % au-dessus de la moyenne des LLM similaires, et 2,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)18,67 $
Durée d'exécution — PinchBench4 h 32 min
Indice valeur/coût — PinchBench8,51
Coût moyen par benchmark — Benchable0,09 $
Latence moyenne par benchmark — Benchable1 min 49 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
PaysUnited States of America

Notre analyse

Forces. À sa sortie, GPT-5.4 figurait dans le top 4 % des 81 LLM de sa génération sur GPQA diamond. Il atteint aussi le top 10 de LiveBench Mathematics et obtient un résultat élevé sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée. Sa fenêtre de 1 050 000 tokens constitue un autre atout concret. Le modèle coûte environ 2,2 fois moins cher que les modèles frontière.

Limites et points d’attention. Dans Arena text, deux classements le placent aux 15e et 35e rangs sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Dans Arena document, il occupe le 11e rang sur 32, derrière Claude Opus 4.6 et Claude Fable 5. Dans les trois cas, GPT-5.4 et le premier restent proches en préférence humaine. Ses scores Benchable sont plafonnés ou presque et partagés par de nombreux modèles, ce qui limite leur portée comparative. Son tarif dépasse de 20 % la moyenne des LLM similaires. GPT-5.4 reste pertinent pour les mathématiques et les usages exigeant une très grande fenêtre de contexte. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · LiveBench (livebench.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).