GPT-5.1

GPT-5.1 est un LLM propriétaire d’OpenAI, lancé le 13 novembre 2025 aux États-Unis. Sa fenêtre de contexte de 400 000 tokens constitue son trait le plus distinctif, tandis que ses connaissances s’arrêtent au 30 septembre 2024. À sa sortie, il appartenait au top 4% des 52 LLM de sa…

GPT-5.1 est un LLM propriétaire d’OpenAI, lancé le 13 novembre 2025 aux États-Unis. Sa fenêtre de contexte de 400 000 tokens constitue son trait le plus distinctif, tandis que ses connaissances s’arrêtent au 30 septembre 2024. À sa sortie, il appartenait au top 4% des 52 LLM de sa génération sur GPQA diamond.

Son autre marqueur est son positionnement très économique. Sa tarification se situe 40% sous la moyenne des LLM similaires et environ 4,4 fois sous celle des modèles frontière. GPT-5.1 associe ainsi un contexte étendu, un niveau compétitif en code et un coût d’exploitation contenu.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie13 novembre 2025
Connaissances jusqu'à2024-09-30
Multimodaloui
Fenêtre de contexte400 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index20.4100ᵉ / 137
Code Index49.433ᵉ / 74
Agentic Index21.037ᵉ / 68
Math Index38.039ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 161benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)96,0 %32ᵉ / 155benchable✅ Mesuré
Benchable : Coding (Baseline)94,0 %32ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)92,0 %61ᵉ / 140benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-202588,6 %12ᵉ / 64epoch✅ Mesuré
Epoch: GPQA diamond87,6 %12ᵉ / 85epoch✅ Mesuré
Benchable : Instruction Following (Baseline)83,0 %23ᵉ / 163benchable✅ Mesuré
Epoch: SWE-Bench verified68,0 %10ᵉ / 15epoch✅ Mesuré
Epoch: SimpleQA Verified48,9 %9ᵉ / 26epoch✅ Mesuré
Epoch: Chess Puzzles32,0 %9ᵉ / 20epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private31,0 %5ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private12,5 %6ᵉ / 25epoch✅ Mesuré
Tau2 Telecom95,6 %10ᵉ / 34llm-statsAuto-déclaré
AIME 202594,0 %22ᵉ / 108llm-statsAuto-déclaré
BrowseComp Long Context 128k90,0 %2ᵉ / 4llm-statsAuto-déclaré
GPQA88,1 %28ᵉ / 219llm-statsAuto-déclaré
MMMU85,4 %2ᵉ / 61llm-statsAuto-déclaré
Tau2 Retail77,9 %10ᵉ / 25llm-statsAuto-déclaré
SWE-Bench Verified76,3 %30ᵉ / 102llm-statsAuto-déclaré
LiveBench72,0 %26ᵉ / 38llm-statsn.d.
Tau2 Airline67,0 %4ᵉ / 22llm-statsAuto-déclaré
FrontierMath26,7 %8ᵉ / 16llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nova 2.0 Pro Preview21.8
▶ GPT-5.120.4

Code Index

Grok Build 0.1 061651.5
▶ GPT-5.149.4
Nemotron 3 Ultra 550B A…49.3

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text145549ᵉ / 200Claude Fable 5 (1507)
Arena Text143969ᵉ / 200Claude Fable 5 (1507)
Arena Image-to-Code142124ᵉ / 31Claude Fable 5 (1627)
Arena Document140131ᵉ / 32Claude Opus 4.6 (1508)
Arena Code139153ᵉ / 99Kimi K3 (1679)
Arena Image-to-Code134528ᵉ / 31Claude Fable 5 (1627)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI1,25 $10 $0,125 $
openai1,25 $10 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 40 % en dessous de la moyenne des LLM similaires, et 4,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,2 $
Latence moyenne par benchmark — Benchable4 min 20 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. Le Code Index est le meilleur de ses quatre indices et place GPT-5.1 dans la première moitié du classement. L’Agentic Index se situe près du milieu de tableau. Sur les deux évaluations Arena text, le modèle occupe les rangs 49 et 69 sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec le premier reste modéré dans les deux cas. Les scores Benchable en Coding et Reasoning sont élevés, mais ces tests plafonnés départagent peu les modèles. Le tarif constitue un avantage net, 40% sous la moyenne des LLM similaires.

Limites et points d’attention. L’Intelligence Index place GPT-5.1 en retrait, au 100e rang sur 137, et le Math Index dans le bas du classement. Les scores de 100% en Hallucinations, General Knowledge et Ethics sont non discriminants : GPT-5.1 partage chaque première place avec respectivement 45, 41 et 71 autres modèles. En image-to-code, il n’est que 24e sur 31, derrière Claude Fable 5 et Claude Opus 4.7. Le premier est nettement devant. GPT-5.1 reste pertinent pour les longs contextes, le code et les usages sensibles au coût. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).