GPT-5.3 Codex
GPT-5.3 Codex est un LLM propriétaire d’OpenAI, lancé le 5 février 2026. Il associe une fenêtre de contexte de 400 000 tokens à un positionnement tarifaire économique, avec des résultats particulièrement solides en connaissances générales, en programmation et en raisonnement.
GPT-5.3 Codex est un LLM propriétaire d’OpenAI, lancé le 5 février 2026. Il associe une fenêtre de contexte de 400 000 tokens à un positionnement tarifaire économique, avec des résultats particulièrement solides en connaissances générales, en programmation et en raisonnement.
Ses poids ne sont pas ouverts. Son prix se situe 12% sous la moyenne des LLM similaires et environ 3,1 fois sous celui des modèles frontière, un écart notable pour un modèle classé dans le haut du tableau par l’Intelligence Index.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 5 février 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 400 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 44.3 | 13ᵉ / 137 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| SWE-Lancer (IC-Diamond subset) | 81,4 % | 2ᵉ / 6 | llm-stats | Auto-déclaré |
| Cybersecurity CTFs | 77,6 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 77,3 % | 4ᵉ / 49 | llm-stats | Auto-déclaré |
| LiveBench | 72,8 % | 23ᵉ / 38 | llm-stats | n.d. |
| OSWorld-Verified | 64,7 % | 14ᵉ / 19 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 56,8 % | 23ᵉ / 41 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Classements Arena (Elo)
Arena Image-to-Code · 31 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1627 |
| 2ᵉ | Claude Opus 4.7 | 1581 |
| 3ᵉ | Claude Opus 4.7 | 1567 |
| ⋯ | ⋯ | |
| 18ᵉ | Gemini 3 Flash | 1457 |
| 19ᵉ | Gemini 3 Pro | 1453 |
| 20ᵉ | GPT-5.3 Codex | 1440 |
| 21ᵉ | Kimi K2.5 | 1439 |
| 22ᵉ | GPT-4.5 | 1435 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 43ᵉ | MiMo-V2.5 | 1429 |
| 44ᵉ | kimi-k2.5-instant | 1408 |
| 45ᵉ | GPT-5.3 Codex | 1406 |
| 46ᵉ | GPT-5.2 | 1406 |
| 47ᵉ | GPT-5.4 mini | 1398 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 43ᵉ | MiMo-V2.5 | 1429 |
| 44ᵉ | kimi-k2.5-instant | 1408 |
| 45ᵉ | GPT-5.3 Codex | 1406 |
| 46ᵉ | GPT-5.2 | 1406 |
| 47ᵉ | GPT-5.4 mini | 1398 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 1,75 $ | 14 $ | 0,175 $ |
| openai | 1,75 $ | 14 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 16 % en dessous de la moyenne des LLM similaires, et 3,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,19 $ |
| Latence moyenne par benchmark — Benchable | 4 min 19 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | United States of America |
Notre analyse
Forces. GPT-5.3 Codex se distingue d’abord en General Knowledge, où il occupe la première place, ainsi qu’en Coding, où il figure parmi les modèles les mieux classés. Son résultat en Reasoning reste élevé, tandis que l’Intelligence Index le place dans le groupe de tête. Les scores obtenus en Ethics, Hallucinations et Email Classification sont également élevés en valeur absolue. La fenêtre de contexte de 400 000 tokens constitue un autre trait marquant. Enfin, son tarif économique renforce son intérêt pour des traitements à grand volume, avec un coût inférieur à la moyenne des modèles comparables.
Limites et points d’attention. Les classements relatifs nuancent certains scores élevés : GPT-5.3 Codex se situe loin des premières places en Ethics, Hallucinations et Email Classification. Les évaluations Arena sont moins favorables que les benchmarks Benchable. En image-to-code, il apparaît dans la seconde moitié du classement, avec un Elo nettement inférieur au modèle en tête. Les deux résultats rapportés en Arena Code le placent respectivement au milieu et dans la seconde moitié du tableau, là encore à distance du leader. Le modèle convient donc surtout aux usages privilégiant les connaissances générales, le code, le raisonnement, une longue fenêtre de contexte et un coût contenu.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).