GPT-4.5

Sorti le 27 février 2025, GPT-4.5 est un LLM propriétaire américain développé par OpenAI. À près d’un an, il appartient déjà à une génération ancienne à l’échelle de l’IA. Ses performances sont aujourd’hui largement dépassées et le modèle est souvent retiré du catalogue de l’éditeur.

Sorti le 27 février 2025, GPT-4.5 est un LLM propriétaire américain développé par OpenAI. À près d’un an, il appartient déjà à une génération ancienne à l’échelle de l’IA. Ses performances sont aujourd’hui largement dépassées et le modèle est souvent retiré du catalogue de l’éditeur.

GPT-4.5 dispose d’une fenêtre de contexte de 128 000 tokens. Son entraînement aurait mobilisé 3,8 × 10²⁶ FLOP, soit l’équivalent d’environ 49 000 GPU H100 pendant trois mois. Son coût estimé atteint 366 millions de dollars, en valeur 2023.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie27 février 2025
Multimodaloui
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: MATH level 578,6 %27ᵉ / 84epoch✅ Mesuré
Epoch: GPQA diamond68,7 %67ᵉ / 140epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-202537,8 %72ᵉ / 119epoch✅ Mesuré
GSM8k97,0 %4ᵉ / 47llm-statsAuto-déclaré
MMLU90,8 %3ᵉ / 98llm-statsAuto-déclaré
CharXiv-D90,0 %5ᵉ / 16llm-statsAuto-déclaré
IFEval88,2 %26ᵉ / 65llm-statsAuto-déclaré
HumanEval88,0 %26ᵉ / 65llm-statsAuto-déclaré
MMMLU85,1 %33ᵉ / 49llm-statsAuto-déclaré
MMMU75,2 %18ᵉ / 61llm-statsAuto-déclaré
Graphwalks parents <128k72,6 %4ᵉ / 11llm-statsAuto-déclaré
COLLIE72,3 %5ᵉ / 10llm-statsAuto-déclaré
Graphwalks BFS <128k72,3 %6ᵉ / 11llm-statsAuto-déclaré
MathVista72,3 %10ᵉ / 38llm-statsAuto-déclaré
Multi-IF70,8 %15ᵉ / 20llm-statsAuto-déclaré
GPQA69,5 %121ᵉ / 220llm-statsAuto-déclaré
TAU-bench Retail68,4 %13ᵉ / 24llm-statsAuto-déclaré
ComplexFuncBench63,0 %4ᵉ / 7llm-statsAuto-déclaré
SimpleQA62,5 %8ᵉ / 45llm-statsAuto-déclaré
CharXiv-R55,4 %40ᵉ / 47llm-statsAuto-déclaré
Internal API instruction following (hard)54,0 %2ᵉ / 7llm-statsAuto-déclaré
TAU-bench Airline50,0 %10ᵉ / 22llm-statsAuto-déclaré
Aider-Polyglot Edit44,9 %7ᵉ / 10llm-statsAuto-déclaré
Multi-Challenge43,8 %19ᵉ / 28llm-statsAuto-déclaré
OpenAI-MRCR: 2 needle 128k38,5 %5ᵉ / 8llm-statsAuto-déclaré
SWE-Bench Verified38,0 %95ᵉ / 102llm-statsAuto-déclaré
SWE-Lancer37,3 %2ᵉ / 4llm-statsAuto-déclaré
AIME 202436,7 %50ᵉ / 52llm-statsAuto-déclaré
SWE-Lancer (IC-Diamond subset)17,4 %4ᵉ / 6llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: MATH level 5

GPT-598 %
▶ GPT-4.579 %

Epoch: GPQA diamond

▶ GPT-4.569 %

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61505
3ᵉClaude Opus 4.71502
61ᵉGemini 2.5 Pro1446
62ᵉinkling1445
63ᵉGPT-4.51445
64ᵉMiniMax M31444
65ᵉQwen3.6 Plus1444

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71306
3ᵉClaude Opus 4.61299
45ᵉQwen3.5-122B-A10B1228
46ᵉGemini 2.5 Flash Preview1225
47ᵉGPT-4.51225
48ᵉgpt-5-chat-2025-08-071225
49ᵉQwen3.5-27B1219

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement3,8 × 10²⁶ FLOP
Jeu de donnéesUnspecified unreleased
Coût d'entraînement estimé≈ 366 010 628 $ (USD 2023)
Durée d'entraînement3 000 h
PaysUnited States of America

Notre analyse

Forces. À sa sortie, GPT-4.5 figurait dans le top 10% des 68 LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Son résultat sur MATH level 5 le plaçait également dans le premier tiers du classement, avec un niveau solide en mathématiques avancées. Sa fenêtre de contexte de 128 000 tokens constituait une autre caractéristique notable.

Limites et points d’attention. GPT-4.5 est désormais en retrait dans les classements. Sur OTIS Mock AIME 2024-2025, il partage la 72e place avec un autre modèle, sur un benchmark plafonné et peu discriminant. Dans Arena text, il se place derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Claude Fable 5 est nettement devant. Dans Arena vision, il reste derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. L’écart avec Claude Fable 5 est important. L’effort d’entraînement reste marquant, avec l’équivalent de 49 000 GPU H100 pendant trois mois et un coût estimé à 366 millions de dollars. Son intérêt est surtout historique et comparatif. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.


Sources des données : OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.