GPT-5.1 Codex
GPT-5.1 Codex est un LLM propriétaire d’OpenAI, sorti le 19 novembre 2025 et spécialisé dans le code. À son lancement, il se situait dans le top 20% des LLM de sa génération sur SWE-Bench Verified, ce qui le plaçait dans le haut du panier pour les tâches de développement logiciel.
GPT-5.1 Codex est un LLM propriétaire d’OpenAI, sorti le 19 novembre 2025 et spécialisé dans le code. À son lancement, il se situait dans le top 20% des LLM de sa génération sur SWE-Bench Verified, ce qui le plaçait dans le haut du panier pour les tâches de développement logiciel.
Le modèle combine une fenêtre de contexte de 400 000 tokens et des connaissances arrêtées au 30 septembre 2024. Son positionnement tarifaire est très économique : ses prix sont inférieurs de 37% à la moyenne des LLM similaires et environ 4,4 fois moins élevés que ceux des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 19 novembre 2025 |
| Connaissances jusqu'à | 2024-09-30 |
| Multimodal | oui |
| Fenêtre de contexte | 400 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 96,7 % | 14ᵉ / 108 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 73,7 % | 39ᵉ / 102 | llm-stats | Auto-déclaré |
| SWE-Lancer | 66,3 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 52,8 % | 31ᵉ / 49 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 73ᵉ | GPT-5.2 Codex | 1334 |
| 74ᵉ | DeepSeek-V3.2 | 1332 |
| 75ᵉ | GPT-5.1 Codex | 1330 |
| 76ᵉ | Kimi K2 0905 | 1330 |
| 77ᵉ | Claude Haiku 4.5 | 1327 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Azure | 1,25 $ | 10 $ | 0,13 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 40 % en dessous de la moyenne des LLM similaires, et 4,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,18 $ |
| Latence moyenne par benchmark — Benchable | 5 min 29 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. GPT-5.1 Codex atteint le premier rang dans les évaluations Benchable consacrées aux hallucinations, aux connaissances générales et à l’éthique. Ses résultats en Coding le placent également dans la partie haute du classement, en cohérence avec son positionnement. À sa sortie, son classement dans le top 20% de sa génération sur SWE-Bench Verified confirmait sa solidité pour la résolution de tâches issues du développement logiciel. Les résultats en Mathematics restent élevés, tandis que la classification d’e-mails obtient un score brut très fort. La fenêtre de 400 000 tokens constitue un autre trait marquant pour le traitement de longs contextes.
Limites et points d’attention. Les classements nuancent certains scores bruts : GPT-5.1 Codex reste en retrait dans Mathematics et Email Classification face à de nombreux concurrents. Dans Arena Code, il occupe le bas du classement, avec un Elo nettement inférieur à celui du modèle en tête. Ses poids ne sont pas ouverts et ses connaissances s’arrêtent au 30 septembre 2024. Son principal avantage pratique réside donc dans un compromis entre compétences en code, contexte étendu et coût très inférieur à celui des modèles haut de gamme. Il cible surtout les usages de programmation sensibles au prix et nécessitant de longs volumes de contexte.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).