GPT-5.1
GPT-5.1 est un LLM propriétaire d’OpenAI, lancé le 13 novembre 2025 aux États-Unis. Sa fenêtre de contexte de 400 000 tokens constitue son trait le plus distinctif, tandis que ses connaissances s’arrêtent au 30 septembre 2024. À sa sortie, il appartenait au top 4% des 52 LLM de sa…
GPT-5.1 est un LLM propriétaire d’OpenAI, lancé le 13 novembre 2025 aux États-Unis. Sa fenêtre de contexte de 400 000 tokens constitue son trait le plus distinctif, tandis que ses connaissances s’arrêtent au 30 septembre 2024. À sa sortie, il appartenait au top 4% des 52 LLM de sa génération sur GPQA diamond.
Son autre marqueur est son positionnement très économique. Sa tarification se situe 40% sous la moyenne des LLM similaires et environ 4,4 fois sous celle des modèles frontière. GPT-5.1 associe ainsi un contexte étendu, un niveau compétitif en code et un coût d’exploitation contenu.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 13 novembre 2025 |
| Connaissances jusqu'à | 2024-09-30 |
| Multimodal | oui |
| Fenêtre de contexte | 400 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 20.4 | 100ᵉ / 137 |
| Code Index | 49.4 | 33ᵉ / 74 |
| Agentic Index | 21.0 | 37ᵉ / 68 |
| Math Index | 38.0 | 39ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 96,0 % | 32ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 94,0 % | 32ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 92,0 % | 61ᵉ / 140 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 88,6 % | 12ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 87,6 % | 12ᵉ / 85 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 83,0 % | 23ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: SWE-Bench verified | 68,0 % | 10ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 48,9 % | 9ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 32,0 % | 9ᵉ / 20 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 31,0 % | 5ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 12,5 % | 6ᵉ / 25 | epoch | ✅ Mesuré |
| Tau2 Telecom | 95,6 % | 10ᵉ / 34 | llm-stats | Auto-déclaré |
| AIME 2025 | 94,0 % | 22ᵉ / 108 | llm-stats | Auto-déclaré |
| BrowseComp Long Context 128k | 90,0 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| GPQA | 88,1 % | 28ᵉ / 219 | llm-stats | Auto-déclaré |
| MMMU | 85,4 % | 2ᵉ / 61 | llm-stats | Auto-déclaré |
| Tau2 Retail | 77,9 % | 10ᵉ / 25 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 76,3 % | 30ᵉ / 102 | llm-stats | Auto-déclaré |
| LiveBench | 72,0 % | 26ᵉ / 38 | llm-stats | n.d. |
| Tau2 Airline | 67,0 % | 4ᵉ / 22 | llm-stats | Auto-déclaré |
| FrontierMath | 26,7 % | 8ᵉ / 16 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1455 | 49ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Text | 1439 | 69ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Image-to-Code | 1421 | 24ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Document | 1401 | 31ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Code | 1391 | 53ᵉ / 99 | Kimi K3 (1679) |
| Arena Image-to-Code | 1345 | 28ᵉ / 31 | Claude Fable 5 (1627) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 1,25 $ | 10 $ | 0,125 $ |
| openai | 1,25 $ | 10 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 40 % en dessous de la moyenne des LLM similaires, et 4,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,2 $ |
| Latence moyenne par benchmark — Benchable | 4 min 20 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. Le Code Index est le meilleur de ses quatre indices et place GPT-5.1 dans la première moitié du classement. L’Agentic Index se situe près du milieu de tableau. Sur les deux évaluations Arena text, le modèle occupe les rangs 49 et 69 sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec le premier reste modéré dans les deux cas. Les scores Benchable en Coding et Reasoning sont élevés, mais ces tests plafonnés départagent peu les modèles. Le tarif constitue un avantage net, 40% sous la moyenne des LLM similaires.
Limites et points d’attention. L’Intelligence Index place GPT-5.1 en retrait, au 100e rang sur 137, et le Math Index dans le bas du classement. Les scores de 100% en Hallucinations, General Knowledge et Ethics sont non discriminants : GPT-5.1 partage chaque première place avec respectivement 45, 41 et 71 autres modèles. En image-to-code, il n’est que 24e sur 31, derrière Claude Fable 5 et Claude Opus 4.7. Le premier est nettement devant. GPT-5.1 reste pertinent pour les longs contextes, le code et les usages sensibles au coût. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).