GPT-5.1 Codex

GPT-5.1 Codex est un LLM propriétaire d’OpenAI, sorti le 19 novembre 2025 et spécialisé dans le code. À son lancement, il se situait dans le top 20% des LLM de sa génération sur SWE-Bench Verified, ce qui le plaçait dans le haut du panier pour les tâches de développement logiciel.

GPT-5.1 Codex est un LLM propriétaire d’OpenAI, sorti le 19 novembre 2025 et spécialisé dans le code. À son lancement, il se situait dans le top 20% des LLM de sa génération sur SWE-Bench Verified, ce qui le plaçait dans le haut du panier pour les tâches de développement logiciel.

Le modèle combine une fenêtre de contexte de 400 000 tokens et des connaissances arrêtées au 30 septembre 2024. Son positionnement tarifaire est très économique : ses prix sont inférieurs de 37% à la moyenne des LLM similaires et environ 4,4 fois moins élevés que ceux des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie19 novembre 2025
Connaissances jusqu'à2024-09-30
Multimodaloui
Fenêtre de contexte400 000 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202596,7 %14ᵉ / 108llm-statsAuto-déclaré
SWE-Bench Verified73,7 %39ᵉ / 102llm-statsAuto-déclaré
SWE-Lancer66,3 %1ᵉ / 4llm-statsAuto-déclaré
Terminal-Bench 2.052,8 %31ᵉ / 49llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
73ᵉGPT-5.2 Codex1334
74ᵉDeepSeek-V3.21332
75ᵉGPT-5.1 Codex1330
76ᵉKimi K2 09051330
77ᵉClaude Haiku 4.51327

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Azure1,25 $10 $0,13 $

Prix en dollars US par million de tokens.

Sa tarification se situe 40 % en dessous de la moyenne des LLM similaires, et 4,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,18 $
Latence moyenne par benchmark — Benchable5 min 29 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. GPT-5.1 Codex atteint le premier rang dans les évaluations Benchable consacrées aux hallucinations, aux connaissances générales et à l’éthique. Ses résultats en Coding le placent également dans la partie haute du classement, en cohérence avec son positionnement. À sa sortie, son classement dans le top 20% de sa génération sur SWE-Bench Verified confirmait sa solidité pour la résolution de tâches issues du développement logiciel. Les résultats en Mathematics restent élevés, tandis que la classification d’e-mails obtient un score brut très fort. La fenêtre de 400 000 tokens constitue un autre trait marquant pour le traitement de longs contextes.

Limites et points d’attention. Les classements nuancent certains scores bruts : GPT-5.1 Codex reste en retrait dans Mathematics et Email Classification face à de nombreux concurrents. Dans Arena Code, il occupe le bas du classement, avec un Elo nettement inférieur à celui du modèle en tête. Ses poids ne sont pas ouverts et ses connaissances s’arrêtent au 30 septembre 2024. Son principal avantage pratique réside donc dans un compromis entre compétences en code, contexte étendu et coût très inférieur à celui des modèles haut de gamme. Il cible surtout les usages de programmation sensibles au prix et nécessitant de longs volumes de contexte.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).