GPT-5.3 Codex

GPT-5.3 Codex est un LLM propriétaire d’OpenAI, lancé le 5 février 2026. Il associe une fenêtre de contexte de 400 000 tokens à un positionnement tarifaire économique, avec des résultats particulièrement solides en connaissances générales, en programmation et en raisonnement.

GPT-5.3 Codex est un LLM propriétaire d’OpenAI, lancé le 5 février 2026. Il associe une fenêtre de contexte de 400 000 tokens à un positionnement tarifaire économique, avec des résultats particulièrement solides en connaissances générales, en programmation et en raisonnement.

Ses poids ne sont pas ouverts. Son prix se situe 12% sous la moyenne des LLM similaires et environ 3,1 fois sous celui des modèles frontière, un écart notable pour un modèle classé dans le haut du tableau par l’Intelligence Index.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie5 février 2026
Multimodaloui
Fenêtre de contexte400 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index44.313ᵉ / 137

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
SWE-Lancer (IC-Diamond subset)81,4 %2ᵉ / 6llm-statsAuto-déclaré
Cybersecurity CTFs77,6 %1ᵉ / 3llm-statsAuto-déclaré
Terminal-Bench 2.077,3 %4ᵉ / 49llm-statsAuto-déclaré
LiveBench72,8 %23ᵉ / 38llm-statsn.d.
OSWorld-Verified64,7 %14ᵉ / 19llm-statsAuto-déclaré
SWE-Bench Pro56,8 %23ᵉ / 41llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ GPT-5.3 Codex44.3
DeepSeek V4 Pro40.8

Classements Arena (Elo)

Arena Image-to-Code · 31 modèles classés

RangModèleElo
1ᵉClaude Fable 51627
2ᵉClaude Opus 4.71581
3ᵉClaude Opus 4.71567
18ᵉGemini 3 Flash1457
19ᵉGemini 3 Pro1453
20ᵉGPT-5.3 Codex1440
21ᵉKimi K2.51439
22ᵉGPT-4.51435

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
43ᵉMiMo-V2.51429
44ᵉkimi-k2.5-instant1408
45ᵉGPT-5.3 Codex1406
46ᵉGPT-5.21406
47ᵉGPT-5.4 mini1398

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
43ᵉMiMo-V2.51429
44ᵉkimi-k2.5-instant1408
45ᵉGPT-5.3 Codex1406
46ᵉGPT-5.21406
47ᵉGPT-5.4 mini1398

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI1,75 $14 $0,175 $
openai1,75 $14 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 16 % en dessous de la moyenne des LLM similaires, et 3,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,19 $
Latence moyenne par benchmark — Benchable4 min 19 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
PaysUnited States of America

Notre analyse

Forces. GPT-5.3 Codex se distingue d’abord en General Knowledge, où il occupe la première place, ainsi qu’en Coding, où il figure parmi les modèles les mieux classés. Son résultat en Reasoning reste élevé, tandis que l’Intelligence Index le place dans le groupe de tête. Les scores obtenus en Ethics, Hallucinations et Email Classification sont également élevés en valeur absolue. La fenêtre de contexte de 400 000 tokens constitue un autre trait marquant. Enfin, son tarif économique renforce son intérêt pour des traitements à grand volume, avec un coût inférieur à la moyenne des modèles comparables.

Limites et points d’attention. Les classements relatifs nuancent certains scores élevés : GPT-5.3 Codex se situe loin des premières places en Ethics, Hallucinations et Email Classification. Les évaluations Arena sont moins favorables que les benchmarks Benchable. En image-to-code, il apparaît dans la seconde moitié du classement, avec un Elo nettement inférieur au modèle en tête. Les deux résultats rapportés en Arena Code le placent respectivement au milieu et dans la seconde moitié du tableau, là encore à distance du leader. Le modèle convient donc surtout aux usages privilégiant les connaissances générales, le code, le raisonnement, une longue fenêtre de contexte et un coût contenu.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).