GPT-5 Codex

GPT-5 Codex est un LLM propriétaire d’OpenAI, sorti le 15 septembre 2025 et positionné sur la programmation. À son lancement, il figurait dans le top 5% des modèles de sa génération sur SWE-Bench Verified, ce qui le plaçait parmi les références contemporaines pour les tâches de…

GPT-5 Codex est un LLM propriétaire d’OpenAI, sorti le 15 septembre 2025 et positionné sur la programmation. À son lancement, il figurait dans le top 5% des modèles de sa génération sur SWE-Bench Verified, ce qui le plaçait parmi les références contemporaines pour les tâches de développement logiciel.

Sa fenêtre de contexte de 400 000 tokens autorise le traitement de volumes importants de code ou de texte. Son positionnement tarifaire est très économique, avec un coût inférieur de 37% à la moyenne des LLM similaires et environ 4,4 fois moindre que celui des modèles frontière. Les résultats présentés reposent sur quatre sources concordantes.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie15 septembre 2025
Connaissances jusqu'à2024-09-30
Multimodalnon
Fenêtre de contexte400 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index36.135ᵉ / 137
Math Index98.72ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
SWE-Bench Verified74,5 %35ᵉ / 102llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nemotron 3 Ultra 550B A…37.8
▶ GPT-5 Codex36.1
Qwen3.5 397B A17B32.0

Math Index

▶ GPT-5 Codex98.7
DeepSeek V3.292.0

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI1,25 $10 $0,125 $

Prix en dollars US par million de tokens.

Sa tarification se situe 40 % en dessous de la moyenne des LLM similaires, et 4,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,18 $
Latence moyenne par benchmark — Benchable6 min 04 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. GPT-5 Codex se distingue d’abord en mathématiques, où son Math Index le classe parmi les tout meilleurs modèles évalués. À sa sortie, son classement dans le top 5% sur SWE-Bench Verified confirmait une forte spécialisation dans la résolution de problèmes de programmation réels. Ses résultats sont également solides en Coding et en Reasoning. Les benchmarks Hallucinations et Ethics le placent au premier rang de leurs évaluations Baseline respectives. Sa grande fenêtre de contexte constitue un autre atout pour analyser de longs dépôts de code, des documents volumineux ou des échanges étendus. L’ensemble est proposé à un tarif nettement inférieur à celui des modèles comparables et haut de gamme.

Limites et points d’attention. Son Intelligence Index le situe derrière les modèles les plus performants de l’échantillon global, malgré ses résultats spécialisés élevés. General Knowledge et Email Classification affichent des scores forts, mais des classements moins distinctifs que ceux obtenus en mathématiques, en éthique ou sur les hallucinations. Ses connaissances s’arrêtent au 30 septembre 2024, ce qui limite la prise en compte d’informations et d’évolutions ultérieures. Enfin, sa licence propriétaire exclut l’accès aux poids. GPT-5 Codex cible surtout le développement logiciel, le raisonnement mathématique et les traitements nécessitant un contexte très étendu, avec une contrainte budgétaire modérée.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Benchable.ai (benchable.ai).