GPT-4
GPT-4 est un LLM propriétaire d’OpenAI, sorti le 28 août 2023. Près de trois ans plus tard, il appartient à une génération déjà ancienne à l’échelle de l’IA. Modèle de premier plan à son lancement, il est désormais probablement dépassé et souvent absent du catalogue courant de son éditeur.
GPT-4 est un LLM propriétaire d’OpenAI, sorti le 28 août 2023. Près de trois ans plus tard, il appartient à une génération déjà ancienne à l’échelle de l’IA. Modèle de premier plan à son lancement, il est désormais probablement dépassé et souvent absent du catalogue courant de son éditeur.
Développé aux États-Unis, GPT-4 a mobilisé 2,1 × 10²⁵ FLOP, soit environ 2 700 GPU H100 pendant trois mois. Son entraînement est estimé à 37,3 millions de dollars. Sa fenêtre de contexte atteint 32 768 tokens et ses connaissances s’arrêtent au 31 décembre 2022.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 28 août 2023 |
| Connaissances jusqu'à | 2022-12-31 |
| Multimodal | oui |
| Fenêtre de contexte | 32 768 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 67,0 % | 65ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 35,7 % | 66ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: MATH level 5 | 23,0 % | 42ᵉ / 59 | epoch | ✅ Mesuré |
| Benchable : Coding (Baseline) | 7,0 % | 150ᵉ / 162 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 1,1 % | 62ᵉ / 64 | epoch | ✅ Mesuré |
| HellaSwag | 95,3 % | 2ᵉ / 27 | llm-stats | Auto-déclaré |
| Winogrande | 87,5 % | 1ᵉ / 22 | llm-stats | Auto-déclaré |
| MMLU | 86,4 % | 28ᵉ / 98 | llm-stats | Auto-déclaré |
| DROP | 80,9 % | 10ᵉ / 29 | llm-stats | Auto-déclaré |
| MGSM | 74,5 % | 20ᵉ / 30 | llm-stats | Auto-déclaré |
| HumanEval | 67,0 % | 58ᵉ / 65 | llm-stats | Auto-déclaré |
| MATH | 42,0 % | 65ᵉ / 70 | llm-stats | Auto-déclaré |
| GPQA | 35,7 % | 199ᵉ / 219 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Ethics (Baseline)
Benchable : Instruction Following (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 30 $ | 60 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 1339 % au-dessus de la moyenne des LLM similaires, et 5,5 fois plus cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 1,21 $ |
| Latence moyenne par benchmark — Benchable | 8 min 10 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 2,1 × 10²⁵ FLOP |
| Taille du jeu d'entraînement | 5,4 × 10¹² |
| Jeu de données | Unspecified unreleased |
| Coût d'entraînement estimé | ≈ 37 334 305 $ (USD 2023) |
| Matériel | NVIDIA A100 SXM4 40 GB |
| Nombre de puces | 25 000 |
| Puissance électrique | 19 904 435 W |
| Durée d'entraînement | 2 280 h |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, GPT-4 figurait dans le haut du panier de sa génération. Son résultat en Instruction Following reste dans la première moitié du classement, signe d’une aptitude correcte à respecter les consignes évaluées. Il obtient aussi 100% en Ethics, mais partage la première place avec 71 autres modèles sur 159. Ce benchmark plafonné ne permet donc pas de le distinguer. Sa fenêtre de 32 768 tokens constitue une autre caractéristique notable du modèle.
Limites et points d’attention. Les évaluations actuelles placent GPT-4 très en retrait. Il approche la queue du classement en Coding et sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques. Ses résultats sont également faibles sur MATH level 5 et GPQA diamond, qui mesure des questions scientifiques de niveau doctorat. Ses connaissances s’arrêtent en 2022. Son tarif premium est 1339% supérieur à la moyenne des LLM similaires et environ 5,5 fois plus élevé que celui des modèles frontière. Ce rapport entre coût et performances est aujourd’hui défavorable. L’effort d’entraînement reste marquant : environ 2 700 GPU H100 mobilisés pendant trois mois, pour un coût estimé à 37,3 millions de dollars.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).