GPT-5.2 Codex

GPT-5.2 Codex est un LLM propriétaire d’OpenAI, publié le 14 janvier 2026. Ses poids ne sont pas ouverts. Sa fenêtre de contexte de 400 000 tokens et son positionnement tarifaire économique constituent ses principaux traits distinctifs.

GPT-5.2 Codex est un LLM propriétaire d’OpenAI, publié le 14 janvier 2026. Ses poids ne sont pas ouverts. Sa fenêtre de contexte de 400 000 tokens et son positionnement tarifaire économique constituent ses principaux traits distinctifs.

À sa sortie, il se classait dans le top 60% des LLM de sa génération sur LiveBench: Global average. Son prix se situe 12% sous la moyenne des modèles similaires et environ 3,1 fois sous celui des modèles frontière, avec un écart marqué entre le coût des tokens d’entrée et de sortie.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie14 janvier 2026
Multimodaloui
Fenêtre de contexte400 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index40.122ᵉ / 137

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
LiveBench74,3 %17ᵉ / 38llm-statsn.d.
Terminal-Bench 2.064,0 %18ᵉ / 49llm-statsAuto-déclaré
SWE-Bench Pro56,4 %25ᵉ / 41llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

DeepSeek V4 Pro40.8
▶ GPT-5.2 Codex40.1
Grok Build 0.1 061639.8

Classements Arena (Elo)

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
71ᵉGPT-5.11340
72ᵉMiMo-V2-Flash1336
73ᵉGPT-5.2 Codex1334
74ᵉDeepSeek-V3.21332
75ᵉGPT-5.1 Codex1330

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI1,75 $14 $0,175 $
openai1,75 $14 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 16 % en dessous de la moyenne des LLM similaires, et 3,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,12 $
Latence moyenne par benchmark — Benchable3 min 59 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. GPT-5.2 Codex atteint le meilleur rang sur les évaluations Benchable consacrées aux hallucinations, aux connaissances générales et à l’éthique, avec des résultats placés dans le top 10. Le raisonnement et les mathématiques affichent également des scores élevés, même si leurs classements sont moins dominants. Son Intelligence Index le place dans la partie supérieure du classement général. La fenêtre de 400 000 tokens apporte une capacité de contexte étendue. Enfin, son tarif économique, inférieur à celui des LLM similaires et nettement plus bas que celui des modèles frontière, renforce son intérêt lorsque le coût constitue un critère central.

Limites et points d'attention. Les résultats en code sont nettement moins favorables : dans Arena Code, GPT-5.2 Codex occupe le rang 70 sur 96, loin du modèle en tête. La classification d’e-mails obtient un score brut élevé, mais seulement une 90e place, signe d’une concurrence très resserrée sur cette tâche. Le raisonnement reste hors du groupe de tête malgré son score élevé. À sa sortie, son classement LiveBench le situait seulement dans le top 60% de sa génération, ce qui traduit un positionnement global intermédiaire. Ce modèle convient surtout aux usages valorisant le contexte long, les connaissances générales et un coût contenu, plutôt qu’aux tâches où la performance en code doit être de premier plan.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).