GPT-5.2 Codex
GPT-5.2 Codex est un LLM propriétaire d’OpenAI, publié le 14 janvier 2026. Ses poids ne sont pas ouverts. Sa fenêtre de contexte de 400 000 tokens et son positionnement tarifaire économique constituent ses principaux traits distinctifs.
GPT-5.2 Codex est un LLM propriétaire d’OpenAI, publié le 14 janvier 2026. Ses poids ne sont pas ouverts. Sa fenêtre de contexte de 400 000 tokens et son positionnement tarifaire économique constituent ses principaux traits distinctifs.
À sa sortie, il se classait dans le top 60% des LLM de sa génération sur LiveBench: Global average. Son prix se situe 12% sous la moyenne des modèles similaires et environ 3,1 fois sous celui des modèles frontière, avec un écart marqué entre le coût des tokens d’entrée et de sortie.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 14 janvier 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 400 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 40.1 | 22ᵉ / 137 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| LiveBench | 74,3 % | 17ᵉ / 38 | llm-stats | n.d. |
| Terminal-Bench 2.0 | 64,0 % | 18ᵉ / 49 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 56,4 % | 25ᵉ / 41 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Classements Arena (Elo)
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 71ᵉ | GPT-5.1 | 1340 |
| 72ᵉ | MiMo-V2-Flash | 1336 |
| 73ᵉ | GPT-5.2 Codex | 1334 |
| 74ᵉ | DeepSeek-V3.2 | 1332 |
| 75ᵉ | GPT-5.1 Codex | 1330 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 1,75 $ | 14 $ | 0,175 $ |
| openai | 1,75 $ | 14 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 16 % en dessous de la moyenne des LLM similaires, et 3,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,12 $ |
| Latence moyenne par benchmark — Benchable | 3 min 59 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. GPT-5.2 Codex atteint le meilleur rang sur les évaluations Benchable consacrées aux hallucinations, aux connaissances générales et à l’éthique, avec des résultats placés dans le top 10. Le raisonnement et les mathématiques affichent également des scores élevés, même si leurs classements sont moins dominants. Son Intelligence Index le place dans la partie supérieure du classement général. La fenêtre de 400 000 tokens apporte une capacité de contexte étendue. Enfin, son tarif économique, inférieur à celui des LLM similaires et nettement plus bas que celui des modèles frontière, renforce son intérêt lorsque le coût constitue un critère central.
Limites et points d'attention. Les résultats en code sont nettement moins favorables : dans Arena Code, GPT-5.2 Codex occupe le rang 70 sur 96, loin du modèle en tête. La classification d’e-mails obtient un score brut élevé, mais seulement une 90e place, signe d’une concurrence très resserrée sur cette tâche. Le raisonnement reste hors du groupe de tête malgré son score élevé. À sa sortie, son classement LiveBench le situait seulement dans le top 60% de sa génération, ce qui traduit un positionnement global intermédiaire. Ce modèle convient surtout aux usages valorisant le contexte long, les connaissances générales et un coût contenu, plutôt qu’aux tâches où la performance en code doit être de premier plan.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).