GPT-4o
GPT-4o est un LLM propriétaire d’OpenAI, sorti le 27 mars 2025. Avec environ un an d’ancienneté, il appartient déjà à une génération ancienne à l’échelle de l’IA, aujourd’hui largement dépassée. À son lancement, il se situait néanmoins dans le haut du panier des LLM de sa génération.
GPT-4o est un LLM propriétaire d’OpenAI, sorti le 27 mars 2025. Avec environ un an d’ancienneté, il appartient déjà à une génération ancienne à l’échelle de l’IA, aujourd’hui largement dépassée. À son lancement, il se situait néanmoins dans le haut du panier des LLM de sa génération.
Le modèle se caractérise par une fenêtre de contexte de 128 000 tokens et des connaissances arrêtées au 31 octobre 2023. Son positionnement tarifaire reste économique : il coûte environ 2,2 fois moins cher que les modèles frontière, malgré un tarif supérieur de 20% à la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 27 mars 2025 |
| Connaissances jusqu'à | 2023-10-31 |
| Multimodal | oui |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 11.2 | 126ᵉ / 137 |
| Code Index | 24.2 | 62ᵉ / 74 |
| Math Index | 6.0 | 53ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 93,0 % | 42ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 90,0 % | 77ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 84,0 % | 63ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 69,0 % | 57ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 53,3 % | 25ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 49,2 % | 42ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: SWE-Bench verified | 31,0 % | 15ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 6,4 % | 44ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 0,3 % | 31ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 0,0 % | 17ᵉ / 33 | epoch | ✅ Mesuré |
| AI2D | 94,2 % | 3ᵉ / 32 | llm-stats | Auto-déclaré |
| DocVQA | 92,8 % | 15ᵉ / 26 | llm-stats | Auto-déclaré |
| MGSM | 90,5 % | 8ᵉ / 30 | llm-stats | Auto-déclaré |
| HumanEval | 90,2 % | 11ᵉ / 65 | llm-stats | Auto-déclaré |
| ChartQA | 85,7 % | 12ᵉ / 24 | llm-stats | Auto-déclaré |
| MMLU | 85,7 % | 35ᵉ / 98 | llm-stats | Auto-déclaré |
| CharXiv-D | 85,3 % | 12ᵉ / 16 | llm-stats | Auto-déclaré |
| DROP | 83,4 % | 7ᵉ / 29 | llm-stats | Auto-déclaré |
| MMMLU | 81,4 % | 38ᵉ / 49 | llm-stats | Auto-déclaré |
| IFEval | 81,0 % | 51ᵉ / 65 | llm-stats | Auto-déclaré |
| MATH | 76,6 % | 24ᵉ / 70 | llm-stats | Auto-déclaré |
| MMLU-Pro | 74,7 % | 69ᵉ / 125 | llm-stats | Auto-déclaré |
| EgoSchema | 72,2 % | 3ᵉ / 9 | llm-stats | Auto-déclaré |
| MMMU | 72,2 % | 26ᵉ / 61 | llm-stats | Auto-déclaré |
| GPQA | 70,1 % | 117ᵉ / 219 | llm-stats | Auto-déclaré |
| ComplexFuncBench | 66,5 % | 1ᵉ / 7 | llm-stats | Auto-déclaré |
| Tau2 Retail | 63,4 % | 22ᵉ / 25 | llm-stats | Auto-déclaré |
| MathVista | 61,4 % | 25ᵉ / 38 | llm-stats | Auto-déclaré |
| VideoMMMU | 61,2 % | 25ᵉ / 26 | llm-stats | Auto-déclaré |
| COLLIE | 61,0 % | 8ᵉ / 10 | llm-stats | Auto-déclaré |
| Multi-IF | 60,9 % | 19ᵉ / 20 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 60,3 % | 19ᵉ / 24 | llm-stats | Auto-déclaré |
| MMMU-Pro | 59,9 % | 49ᵉ / 64 | llm-stats | Auto-déclaré |
| CharXiv-R | 58,8 % | 34ᵉ / 45 | llm-stats | Auto-déclaré |
| Tau2 Airline | 45,5 % | 20ᵉ / 22 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 42,8 % | 18ᵉ / 22 | llm-stats | Auto-déclaré |
| Graphwalks BFS <128k | 41,7 % | 9ᵉ / 10 | llm-stats | Auto-déclaré |
| Multi-Challenge | 40,3 % | 21ᵉ / 28 | llm-stats | Auto-déclaré |
| SimpleQA | 38,2 % | 21ᵉ / 45 | llm-stats | Auto-déclaré |
| Graphwalks parents <128k | 35,4 % | 9ᵉ / 10 | llm-stats | Auto-déclaré |
| ERQA | 35,2 % | 22ᵉ / 22 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 33,2 % | 97ᵉ / 102 | llm-stats | Auto-déclaré |
| SWE-Lancer | 32,6 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| OpenAI-MRCR: 2 needle 128k | 31,9 % | 7ᵉ / 8 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 30,7 % | 20ᵉ / 22 | llm-stats | Auto-déclaré |
| Internal API instruction following (hard) | 29,2 % | 7ᵉ / 7 | llm-stats | Auto-déclaré |
| Tau2 Telecom | 23,5 % | 33ᵉ / 34 | llm-stats | Auto-déclaré |
| Aider-Polyglot Edit | 18,2 % | 9ᵉ / 10 | llm-stats | Auto-déclaré |
| AIME 2024 | 13,1 % | 52ᵉ / 52 | llm-stats | Auto-déclaré |
| SWE-Lancer (IC-Diamond subset) | 12,4 % | 5ᵉ / 6 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 5,3 % | 84ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 190ᵉ | qwen-plus-0125 | 1346 |
| 191ᵉ | MiniMax M2 | 1346 |
| 192ᵉ | GPT-4o | 1346 |
| 193ᵉ | NVIDIA: Llama 3.3 Nemotron Super 49B V1.5 | 1343 |
| 194ᵉ | glm-4-plus-0111 | 1343 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 77ᵉ | gemini-2.0-flash-001 | 1172 |
| 78ᵉ | Z.ai: GLM 4.6V | 1164 |
| 79ᵉ | GPT-4o | 1162 |
| 80ᵉ | Claude 3.5 Sonnet | 1160 |
| 81ᵉ | hunyuan-vision-1.5-thinking | 1159 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 77ᵉ | gemini-2.0-flash-001 | 1172 |
| 78ᵉ | Z.ai: GLM 4.6V | 1164 |
| 79ᵉ | GPT-4o | 1162 |
| 80ᵉ | Claude 3.5 Sonnet | 1160 |
| 81ᵉ | hunyuan-vision-1.5-thinking | 1159 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 2,5 $ | 10 $ | 1,25 $ |
| Azure | 2,5 $ | 10 $ | n.d. |
| Azure | 5 $ | 15 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 20 % au-dessus de la moyenne des LLM similaires, et 2,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,11 $ |
| Latence moyenne par benchmark — Benchable | 2 min 53 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, GPT-4o figurait dans le top 27% des LLM de sa génération sur Epoch: GPQA diamond. Sa fenêtre de contexte étendue constitue son principal atout pratique. Son score de 93% sur Benchable Coding témoigne aussi de capacités correctes en programmation, même si ce benchmark plafonné distingue peu les modèles. Son prix reste contenu face aux modèles haut de gamme.
Limites et points d’attention. Les indices actuels placent GPT-4o en bas de classement en intelligence et en code, tandis que le Math Index le situe presque dernier. Dans l’Arena text, il est 192e sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Claude Fable 5 est nettement devant. En vision, ses deux résultats le classent 79e et 102e sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. Là encore, Claude Fable 5 est nettement devant. Les scores de 100% sur plusieurs tests Benchable sont partagés par de nombreux modèles et ne sont pas discriminants. La coupure des connaissances à octobre 2023 accentue son vieillissement. Ses performances sont aujourd’hui largement dépassées et il n’est souvent plus proposé par l’éditeur. GPT-4o conserve surtout un intérêt comme référence historique. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).