GPT-5

GPT-5 est un LLM propriétaire d’OpenAI, sorti le 7 août 2025. Il se caractérise par une fenêtre de contexte de 400 000 tokens et des connaissances arrêtées au 30 septembre 2024.

GPT-5 est un LLM propriétaire d’OpenAI, sorti le 7 août 2025. Il se caractérise par une fenêtre de contexte de 400 000 tokens et des connaissances arrêtées au 30 septembre 2024.

Son positionnement tarifaire est très économique : ses tarifs se situent 40 % sous la moyenne des LLM similaires et environ 4.4 fois sous ceux des modèles frontière. Son entraînement représente 6.6 × 10²⁵ FLOP, soit environ 18.3 millions d’heures-GPU H100, l’équivalent de 8 500 GPU H100 utilisés pendant trois mois.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie7 août 2025
Connaissances jusqu'à2024-09-30
Multimodaloui
Fenêtre de contexte400 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index34.739ᵉ / 137
Code Index37.849ᵉ / 74
Agentic Index25.728ᵉ / 68
Math Index94.35ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 161benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Epoch: MATH level 598,1 %1ᵉ / 59epoch✅ Mesuré
Benchable : Hallucinations (Baseline)98,0 %47ᵉ / 146benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)98,0 %16ᵉ / 155benchable✅ Mesuré
Benchable : Coding (Baseline)93,0 %42ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)92,0 %61ᵉ / 140benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-202591,4 %10ᵉ / 64epoch✅ Mesuré
Benchable : Instruction Following (Baseline)91,0 %8ᵉ / 163benchable✅ Mesuré
Epoch: GPQA diamond86,2 %13ᵉ / 85epoch✅ Mesuré
Epoch: SWE-Bench verified73,6 %6ᵉ / 15epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public70,0 %2ᵉ / 33epoch✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private55,4 %9ᵉ / 17epoch✅ Mesuré
Epoch: SimpleQA Verified50,6 %8ᵉ / 26epoch✅ Mesuré
Epoch: Chess Puzzles37,0 %7ᵉ / 20epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private32,4 %4ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private22,0 %9ᵉ / 18epoch✅ Mesuré
Epoch: EBR-bench12,7 %5ᵉ / 7epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private12,5 %6ᵉ / 25epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Public0,0 %1ᵉ / 15epoch✅ Mesuré
SWE-Lancer (IC-Diamond subset)100,0 %1ᵉ / 6llm-statsAuto-déclaré
COLLIE99,0 %1ᵉ / 10llm-statsAuto-déclaré
Tau2 Telecom96,7 %9ᵉ / 34llm-statsAuto-déclaré
OpenAI-MRCR: 2 needle 128k95,2 %1ᵉ / 8llm-statsAuto-déclaré
AIME 202594,6 %20ᵉ / 108llm-statsAuto-déclaré
HumanEval93,4 %4ᵉ / 65llm-statsAuto-déclaré
HMMT 202593,3 %12ᵉ / 33llm-statsAuto-déclaré
MMLU92,5 %1ᵉ / 98llm-statsAuto-déclaré
BrowseComp Long Context 128k90,0 %2ᵉ / 4llm-statsAuto-déclaré
Aider-Polyglot88,0 %1ᵉ / 22llm-statsAuto-déclaré
VideoMME w sub.86,7 %4ᵉ / 9llm-statsAuto-déclaré
GPQA85,7 %42ᵉ / 219llm-statsAuto-déclaré
MATH84,7 %13ᵉ / 70llm-statsAuto-déclaré
VideoMMMU84,6 %7ᵉ / 26llm-statsAuto-déclaré
MMMU84,2 %4ᵉ / 61llm-statsAuto-déclaré
CharXiv-R81,1 %17ᵉ / 45llm-statsAuto-déclaré
Tau2 Retail81,1 %7ᵉ / 25llm-statsAuto-déclaré
MMMU-Pro78,4 %18ᵉ / 64llm-statsAuto-déclaré
Graphwalks BFS <128k78,3 %2ᵉ / 10llm-statsAuto-déclaré
SWE-Bench Verified74,9 %33ᵉ / 102llm-statsAuto-déclaré
Graphwalks parents <128k73,3 %2ᵉ / 10llm-statsAuto-déclaré
Multi-Challenge69,6 %4ᵉ / 28llm-statsAuto-déclaré
ERQA65,7 %4ᵉ / 22llm-statsAuto-déclaré
Internal API instruction following (hard)64,0 %1ᵉ / 7llm-statsAuto-déclaré
Tau2 Airline62,6 %10ᵉ / 22llm-statsAuto-déclaré
BrowseComp54,9 %38ᵉ / 57llm-statsAuto-déclaré
FrontierMath26,3 %10ᵉ / 16llm-statsAuto-déclaré
Humanity's Last Exam24,8 %48ᵉ / 89llm-statsAuto-déclaré
HealthBench Hard1,6 %9ᵉ / 9llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nemotron 3 Ultra 550B A…37.8
▶ GPT-534.7
Qwen3.5 397B A17B32.0

Code Index

Qwen3.5 122B A10B43.3
▶ GPT-537.8
Nova 2.0 Pro Preview34.0

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
75ᵉGPT-5.21435
76ᵉqwen3-max-preview1435
77ᵉGPT-51434
78ᵉMiMo-V2.51432
79ᵉGemini 3.1 Flash-Lite1432

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
49ᵉMiniMax M2.71395
50ᵉGLM-5V-Turbo1395
51ᵉGPT-51395
52ᵉminimax-m2.1-preview1392
53ᵉGPT-5.11391

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
54ᵉGemini 2.5 Flash1214
55ᵉGPT-4.11214
56ᵉGPT-51211
57ᵉClaude Sonnet 41207
58ᵉClaude Opus 41206

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Azure1,25 $10 $0,125 $

Prix en dollars US par million de tokens.

Sa tarification se situe 40 % en dessous de la moyenne des LLM similaires, et 4,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,35 $
Latence moyenne par benchmark — Benchable10 min 56 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement6,6 × 10²⁵ FLOP
PaysUnited States of America

Notre analyse

Forces. GPT-5 se distingue surtout en mathématiques. Il appartient au top 10 du Math Index et occupe la première place sur Epoch: MATH level 5 avec 98 %. À sa sortie, son résultat sur GPQA diamond le situait dans le top 2 % des LLM de sa génération. Sa grande fenêtre de contexte et son tarif économique renforcent son intérêt pour le traitement de longs contenus à coût maîtrisé.

Limites et points d’attention. Les Intelligence Index, Code Index et Agentic Index ne retrouvent pas ce niveau d’excellence. Dans l’Arena text, GPT-5 est 77e sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Claude Fable 5 est nettement devant. Dans l’Arena code, il est 51e sur 99, derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. Kimi K3 est nettement devant. Dans l’Arena vision, il est 56e sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. Claude Fable 5 est nettement devant. GPT-5 reste pertinent pour les mathématiques, les longs contextes et les usages sensibles au coût. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.7 ou Kimi K3.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).