GPT-5.5
GPT-5.5 est un LLM propriétaire d’OpenAI, lancé le 23 avril 2026 et positionné sur le segment premium. À sa sortie, il se classait dans le top 4 % des LLM de sa génération sur GPQA diamond, avec des résultats particulièrement élevés en raisonnement, en connaissances générales et en…
GPT-5.5 est un LLM propriétaire d’OpenAI, lancé le 23 avril 2026 et positionné sur le segment premium. À sa sortie, il se classait dans le top 4 % des LLM de sa génération sur GPQA diamond, avec des résultats particulièrement élevés en raisonnement, en connaissances générales et en mathématiques.
Sa fenêtre de contexte de 1 050 000 tokens constitue l’un de ses principaux traits distinctifs. Ses connaissances s’arrêtent au 1er décembre 2025. Les tarifs, fixés à 5 $ par million de tokens en entrée et 30 $ en sortie, dépassent nettement la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 23 avril 2026 |
| Connaissances jusqu'à | 2025-12-01 |
| Multimodal | oui |
| Fenêtre de contexte | 1 050 000 tokens (≈ 1,1 M) |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 43.5 | 16ᵉ / 137 |
| Code Index | 60.9 | 15ᵉ / 74 |
| Agentic Index | 30.4 | 18ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Tau2 Telecom | 98,0 % | 6ᵉ / 34 | llm-stats | Auto-déclaré |
| ARC-AGI | 95,0 % | 1ᵉ / 7 | llm-stats | Auto-déclaré |
| GPQA | 93,6 % | 5ᵉ / 219 | llm-stats | Auto-déclaré |
| ARC-AGI v2 | 85,0 % | 1ᵉ / 16 | llm-stats | Auto-déclaré |
| GDPval-MM | 84,9 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| BrowseComp | 84,4 % | 11ᵉ / 57 | llm-stats | Auto-déclaré |
| MMMU-Pro | 83,2 % | 2ᵉ / 64 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 82,7 % | 1ᵉ / 49 | llm-stats | Auto-déclaré |
| CyberGym | 81,8 % | 2ᵉ / 9 | llm-stats | Auto-déclaré |
| LiveBench | 80,7 % | 2ᵉ / 38 | llm-stats | n.d. |
| OSWorld-Verified | 78,7 % | 6ᵉ / 19 | llm-stats | Auto-déclaré |
| MCP Atlas | 75,3 % | 12ᵉ / 30 | llm-stats | Auto-déclaré |
| MRCR v2 (8-needle) | 74,0 % | 4ᵉ / 19 | llm-stats | Auto-déclaré |
| FrontierSWE | 73,0 % | 5ᵉ / 14 | llm-stats | n.d. |
| Finance Agent | 60,0 % | 4ᵉ / 8 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 58,6 % | 14ᵉ / 41 | llm-stats | Auto-déclaré |
| Graphwalks parents >128k | 58,5 % | 3ᵉ / 7 | llm-stats | Auto-déclaré |
| Toolathlon | 55,6 % | 6ᵉ / 30 | llm-stats | Auto-déclaré |
| OfficeQA Pro | 54,1 % | 6ᵉ / 7 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 52,2 % | 15ᵉ / 89 | llm-stats | Auto-déclaré |
| Finance Agent v2 | 51,8 % | 5ᵉ / 26 | llm-stats | n.d. |
| Graphwalks BFS >128k | 45,4 % | 7ᵉ / 11 | llm-stats | Auto-déclaré |
| GDPval-AA | 37,8 % | 29ᵉ / 39 | llm-stats | n.d. |
| FrontierMath | 35,4 % | 7ᵉ / 16 | llm-stats | Auto-déclaré |
| Legal Agent Benchmark | 2,1 % | 6ᵉ / 12 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Image-to-Code | 1525 | 8ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Image-to-Code | 1510 | 12ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Code | 1504 | 20ᵉ / 99 | Kimi K3 (1679) |
| Arena Image-to-Code | 1495 | 13ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Document | 1488 | 6ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Code | 1482 | 24ᵉ / 99 | Kimi K3 (1679) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 5 $ | 30 $ | 0,5 $ |
| openai | 5 $ | 30 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 140 % au-dessus de la moyenne des LLM similaires, et 1,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 31,63 $ |
| Durée d'exécution — PinchBench | 4 h 42 min |
| Indice valeur/coût — PinchBench | 4,01 |
| Coût moyen par benchmark — Benchable | 0,38 $ |
| Latence moyenne par benchmark — Benchable | 4 min 11 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Matériel | NVIDIA GB200,NVIDIA GB300 (Blackwell Ultra) |
| Pays | United States of America |
Notre analyse
Forces. GPT-5.5 atteint le meilleur niveau observé sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée), ainsi que sur les évaluations Baseline de connaissances générales, de raisonnement et d’éthique. Son Code Index le place également parmi les modèles les mieux classés de l’échantillon. En image-to-code, ses deux évaluations Arena le situent entre la cinquième et la huitième place, ce qui confirme une aptitude compétitive à produire du code depuis une interface visuelle. La fenêtre d’environ 1,1 million de tokens convient au traitement de volumes textuels particulièrement longs.
Limites et points d’attention. Les performances sont moins dominantes dès que les tâches deviennent plus appliquées. GPT-5.5 occupe seulement la 18e place en Arena code, tandis que la classification d’e-mails et le benchmark consacré aux hallucinations le placent nettement derrière de nombreux concurrents malgré des scores absolus élevés. L’Agentic Index reste solide, mais moins bien classé que ses résultats en code et en intelligence générale. Sa tarification est 151 % supérieure à la moyenne des LLM similaires, même si elle reste environ 1,1 fois moins chère que celle des modèles frontière. GPT-5.5 cible ainsi les usages exigeant un contexte massif, un raisonnement robuste et un budget premium.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).