GPT-5.5

GPT-5.5 est un LLM propriétaire d’OpenAI, lancé le 23 avril 2026 et positionné sur le segment premium. À sa sortie, il se classait dans le top 4 % des LLM de sa génération sur GPQA diamond, avec des résultats particulièrement élevés en raisonnement, en connaissances générales et en…

GPT-5.5 est un LLM propriétaire d’OpenAI, lancé le 23 avril 2026 et positionné sur le segment premium. À sa sortie, il se classait dans le top 4 % des LLM de sa génération sur GPQA diamond, avec des résultats particulièrement élevés en raisonnement, en connaissances générales et en mathématiques.

Sa fenêtre de contexte de 1 050 000 tokens constitue l’un de ses principaux traits distinctifs. Ses connaissances s’arrêtent au 1er décembre 2025. Les tarifs, fixés à 5 $ par million de tokens en entrée et 30 $ en sortie, dépassent nettement la moyenne des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie23 avril 2026
Connaissances jusqu'à2025-12-01
Multimodaloui
Fenêtre de contexte1 050 000 tokens (≈ 1,1 M)
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index43.516ᵉ / 137
Code Index60.915ᵉ / 74
Agentic Index30.418ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Tau2 Telecom98,0 %6ᵉ / 34llm-statsAuto-déclaré
ARC-AGI95,0 %1ᵉ / 7llm-statsAuto-déclaré
GPQA93,6 %5ᵉ / 219llm-statsAuto-déclaré
ARC-AGI v285,0 %1ᵉ / 16llm-statsAuto-déclaré
GDPval-MM84,9 %1ᵉ / 3llm-statsAuto-déclaré
BrowseComp84,4 %11ᵉ / 57llm-statsAuto-déclaré
MMMU-Pro83,2 %2ᵉ / 64llm-statsAuto-déclaré
Terminal-Bench 2.082,7 %1ᵉ / 49llm-statsAuto-déclaré
CyberGym81,8 %2ᵉ / 9llm-statsAuto-déclaré
LiveBench80,7 %2ᵉ / 38llm-statsn.d.
OSWorld-Verified78,7 %6ᵉ / 19llm-statsAuto-déclaré
MCP Atlas75,3 %12ᵉ / 30llm-statsAuto-déclaré
MRCR v2 (8-needle)74,0 %4ᵉ / 19llm-statsAuto-déclaré
FrontierSWE73,0 %5ᵉ / 14llm-statsn.d.
Finance Agent60,0 %4ᵉ / 8llm-statsAuto-déclaré
SWE-Bench Pro58,6 %14ᵉ / 41llm-statsAuto-déclaré
Graphwalks parents >128k58,5 %3ᵉ / 7llm-statsAuto-déclaré
Toolathlon55,6 %6ᵉ / 30llm-statsAuto-déclaré
OfficeQA Pro54,1 %6ᵉ / 7llm-statsAuto-déclaré
Humanity's Last Exam52,2 %15ᵉ / 89llm-statsAuto-déclaré
Finance Agent v251,8 %5ᵉ / 26llm-statsn.d.
Graphwalks BFS >128k45,4 %7ᵉ / 11llm-statsAuto-déclaré
GDPval-AA37,8 %29ᵉ / 39llm-statsn.d.
FrontierMath35,4 %7ᵉ / 16llm-statsAuto-déclaré
Legal Agent Benchmark2,1 %6ᵉ / 12llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ GPT-5.543.5
DeepSeek V4 Pro40.8

Code Index

▶ GPT-5.560.9

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Image-to-Code15258ᵉ / 31Claude Fable 5 (1627)
Arena Image-to-Code151012ᵉ / 31Claude Fable 5 (1627)
Arena Code150420ᵉ / 99Kimi K3 (1679)
Arena Image-to-Code149513ᵉ / 31Claude Fable 5 (1627)
Arena Document14886ᵉ / 32Claude Opus 4.6 (1508)
Arena Code148224ᵉ / 99Kimi K3 (1679)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI5 $30 $0,5 $
openai5 $30 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 140 % au-dessus de la moyenne des LLM similaires, et 1,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)31,63 $
Durée d'exécution — PinchBench4 h 42 min
Indice valeur/coût — PinchBench4,01
Coût moyen par benchmark — Benchable0,38 $
Latence moyenne par benchmark — Benchable4 min 11 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
MatérielNVIDIA GB200,NVIDIA GB300 (Blackwell Ultra)
PaysUnited States of America

Notre analyse

Forces. GPT-5.5 atteint le meilleur niveau observé sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée), ainsi que sur les évaluations Baseline de connaissances générales, de raisonnement et d’éthique. Son Code Index le place également parmi les modèles les mieux classés de l’échantillon. En image-to-code, ses deux évaluations Arena le situent entre la cinquième et la huitième place, ce qui confirme une aptitude compétitive à produire du code depuis une interface visuelle. La fenêtre d’environ 1,1 million de tokens convient au traitement de volumes textuels particulièrement longs.

Limites et points d’attention. Les performances sont moins dominantes dès que les tâches deviennent plus appliquées. GPT-5.5 occupe seulement la 18e place en Arena code, tandis que la classification d’e-mails et le benchmark consacré aux hallucinations le placent nettement derrière de nombreux concurrents malgré des scores absolus élevés. L’Agentic Index reste solide, mais moins bien classé que ses résultats en code et en intelligence générale. Sa tarification est 151 % supérieure à la moyenne des LLM similaires, même si elle reste environ 1,1 fois moins chère que celle des modèles frontière. GPT-5.5 cible ainsi les usages exigeant un contexte massif, un raisonnement robuste et un budget premium.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).