GPT-4

GPT-4 est un LLM propriétaire d’OpenAI, sorti le 28 août 2023. Près de trois ans plus tard, il appartient à une génération déjà ancienne à l’échelle de l’IA. Modèle de premier plan à son lancement, il est désormais probablement dépassé et souvent absent du catalogue courant de son éditeur.

GPT-4 est un LLM propriétaire d’OpenAI, sorti le 28 août 2023. Près de trois ans plus tard, il appartient à une génération déjà ancienne à l’échelle de l’IA. Modèle de premier plan à son lancement, il est désormais probablement dépassé et souvent absent du catalogue courant de son éditeur.

Développé aux États-Unis, GPT-4 a mobilisé 2,1 × 10²⁵ FLOP, soit environ 2 700 GPU H100 pendant trois mois. Son entraînement est estimé à 37,3 millions de dollars. Sa fenêtre de contexte atteint 32 768 tokens et ses connaissances s’arrêtent au 31 décembre 2022.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie28 août 2023
Connaissances jusqu'à2022-12-31
Multimodaloui
Fenêtre de contexte32 768 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : Instruction Following (Baseline)67,0 %65ᵉ / 163benchable✅ Mesuré
Epoch: GPQA diamond35,7 %66ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 523,0 %42ᵉ / 59epoch✅ Mesuré
Benchable : Coding (Baseline)7,0 %150ᵉ / 162benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-20251,1 %62ᵉ / 64epoch✅ Mesuré
HellaSwag95,3 %2ᵉ / 27llm-statsAuto-déclaré
Winogrande87,5 %1ᵉ / 22llm-statsAuto-déclaré
MMLU86,4 %28ᵉ / 98llm-statsAuto-déclaré
DROP80,9 %10ᵉ / 29llm-statsAuto-déclaré
MGSM74,5 %20ᵉ / 30llm-statsAuto-déclaré
HumanEval67,0 %58ᵉ / 65llm-statsAuto-déclaré
MATH42,0 %65ᵉ / 70llm-statsAuto-déclaré
GPQA35,7 %199ᵉ / 219llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

▶ GPT-4100 %
command-r-plus-08-202499 %

Benchable : Instruction Following (Baseline)

laguna-xs-2.168 %
▶ GPT-467 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI30 $60 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 1339 % au-dessus de la moyenne des LLM similaires, et 5,5 fois plus cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable1,21 $
Latence moyenne par benchmark — Benchable8 min 10 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement2,1 × 10²⁵ FLOP
Taille du jeu d'entraînement5,4 × 10¹²
Jeu de donnéesUnspecified unreleased
Coût d'entraînement estimé≈ 37 334 305 $ (USD 2023)
MatérielNVIDIA A100 SXM4 40 GB
Nombre de puces25 000
Puissance électrique19 904 435 W
Durée d'entraînement2 280 h
PaysUnited States of America

Notre analyse

Forces. À sa sortie, GPT-4 figurait dans le haut du panier de sa génération. Son résultat en Instruction Following reste dans la première moitié du classement, signe d’une aptitude correcte à respecter les consignes évaluées. Il obtient aussi 100% en Ethics, mais partage la première place avec 71 autres modèles sur 159. Ce benchmark plafonné ne permet donc pas de le distinguer. Sa fenêtre de 32 768 tokens constitue une autre caractéristique notable du modèle.

Limites et points d’attention. Les évaluations actuelles placent GPT-4 très en retrait. Il approche la queue du classement en Coding et sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques. Ses résultats sont également faibles sur MATH level 5 et GPQA diamond, qui mesure des questions scientifiques de niveau doctorat. Ses connaissances s’arrêtent en 2022. Son tarif premium est 1339% supérieur à la moyenne des LLM similaires et environ 5,5 fois plus élevé que celui des modèles frontière. Ce rapport entre coût et performances est aujourd’hui défavorable. L’effort d’entraînement reste marquant : environ 2 700 GPU H100 mobilisés pendant trois mois, pour un coût estimé à 37,3 millions de dollars.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).