GPT-4.5
Sorti le 27 février 2025, GPT-4.5 est un LLM propriétaire américain développé par OpenAI. À près d’un an, il appartient déjà à une génération ancienne à l’échelle de l’IA. Ses performances sont aujourd’hui largement dépassées et le modèle est souvent retiré du catalogue de l’éditeur.
Sorti le 27 février 2025, GPT-4.5 est un LLM propriétaire américain développé par OpenAI. À près d’un an, il appartient déjà à une génération ancienne à l’échelle de l’IA. Ses performances sont aujourd’hui largement dépassées et le modèle est souvent retiré du catalogue de l’éditeur.
GPT-4.5 dispose d’une fenêtre de contexte de 128 000 tokens. Son entraînement aurait mobilisé 3,8 × 10²⁶ FLOP, soit l’équivalent d’environ 49 000 GPU H100 pendant trois mois. Son coût estimé atteint 366 millions de dollars, en valeur 2023.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 27 février 2025 |
| Multimodal | oui |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: MATH level 5 | 78,6 % | 27ᵉ / 84 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 68,7 % | 67ᵉ / 140 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 37,8 % | 72ᵉ / 119 | epoch | ✅ Mesuré |
| GSM8k | 97,0 % | 4ᵉ / 47 | llm-stats | Auto-déclaré |
| MMLU | 90,8 % | 3ᵉ / 98 | llm-stats | Auto-déclaré |
| CharXiv-D | 90,0 % | 5ᵉ / 16 | llm-stats | Auto-déclaré |
| IFEval | 88,2 % | 26ᵉ / 65 | llm-stats | Auto-déclaré |
| HumanEval | 88,0 % | 26ᵉ / 65 | llm-stats | Auto-déclaré |
| MMMLU | 85,1 % | 33ᵉ / 49 | llm-stats | Auto-déclaré |
| MMMU | 75,2 % | 18ᵉ / 61 | llm-stats | Auto-déclaré |
| Graphwalks parents <128k | 72,6 % | 4ᵉ / 11 | llm-stats | Auto-déclaré |
| COLLIE | 72,3 % | 5ᵉ / 10 | llm-stats | Auto-déclaré |
| Graphwalks BFS <128k | 72,3 % | 6ᵉ / 11 | llm-stats | Auto-déclaré |
| MathVista | 72,3 % | 10ᵉ / 38 | llm-stats | Auto-déclaré |
| Multi-IF | 70,8 % | 15ᵉ / 20 | llm-stats | Auto-déclaré |
| GPQA | 69,5 % | 121ᵉ / 220 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 68,4 % | 13ᵉ / 24 | llm-stats | Auto-déclaré |
| ComplexFuncBench | 63,0 % | 4ᵉ / 7 | llm-stats | Auto-déclaré |
| SimpleQA | 62,5 % | 8ᵉ / 45 | llm-stats | Auto-déclaré |
| CharXiv-R | 55,4 % | 40ᵉ / 47 | llm-stats | Auto-déclaré |
| Internal API instruction following (hard) | 54,0 % | 2ᵉ / 7 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 50,0 % | 10ᵉ / 22 | llm-stats | Auto-déclaré |
| Aider-Polyglot Edit | 44,9 % | 7ᵉ / 10 | llm-stats | Auto-déclaré |
| Multi-Challenge | 43,8 % | 19ᵉ / 28 | llm-stats | Auto-déclaré |
| OpenAI-MRCR: 2 needle 128k | 38,5 % | 5ᵉ / 8 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 38,0 % | 95ᵉ / 102 | llm-stats | Auto-déclaré |
| SWE-Lancer | 37,3 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| AIME 2024 | 36,7 % | 50ᵉ / 52 | llm-stats | Auto-déclaré |
| SWE-Lancer (IC-Diamond subset) | 17,4 % | 4ᵉ / 6 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: MATH level 5
Epoch: GPQA diamond
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1505 |
| 3ᵉ | Claude Opus 4.7 | 1502 |
| ⋯ | ⋯ | |
| 61ᵉ | Gemini 2.5 Pro | 1446 |
| 62ᵉ | inkling | 1445 |
| 63ᵉ | GPT-4.5 | 1445 |
| 64ᵉ | MiniMax M3 | 1444 |
| 65ᵉ | Qwen3.6 Plus | 1444 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1306 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 45ᵉ | Qwen3.5-122B-A10B | 1228 |
| 46ᵉ | Gemini 2.5 Flash Preview | 1225 |
| 47ᵉ | GPT-4.5 | 1225 |
| 48ᵉ | gpt-5-chat-2025-08-07 | 1225 |
| 49ᵉ | Qwen3.5-27B | 1219 |
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 3,8 × 10²⁶ FLOP |
| Jeu de données | Unspecified unreleased |
| Coût d'entraînement estimé | ≈ 366 010 628 $ (USD 2023) |
| Durée d'entraînement | 3 000 h |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, GPT-4.5 figurait dans le top 10% des 68 LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Son résultat sur MATH level 5 le plaçait également dans le premier tiers du classement, avec un niveau solide en mathématiques avancées. Sa fenêtre de contexte de 128 000 tokens constituait une autre caractéristique notable.
Limites et points d’attention. GPT-4.5 est désormais en retrait dans les classements. Sur OTIS Mock AIME 2024-2025, il partage la 72e place avec un autre modèle, sur un benchmark plafonné et peu discriminant. Dans Arena text, il se place derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Claude Fable 5 est nettement devant. Dans Arena vision, il reste derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. L’écart avec Claude Fable 5 est important. L’effort d’entraînement reste marquant, avec l’équivalent de 49 000 GPU H100 pendant trois mois et un coût estimé à 366 millions de dollars. Son intérêt est surtout historique et comparatif. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.