GPT-5.6 Sol

GPT-5.6 Sol est un LLM propriétaire d’OpenAI, lancé le 9 juillet 2026. Ce modèle premium se distingue par une fenêtre de contexte de 1 050 000 tokens et par son positionnement de premier plan en programmation, en mathématiques et dans les tâches agentiques.

GPT-5.6 Sol est un LLM propriétaire d’OpenAI, lancé le 9 juillet 2026. Ce modèle premium se distingue par une fenêtre de contexte de 1 050 000 tokens et par son positionnement de premier plan en programmation, en mathématiques et dans les tâches agentiques.

À sa sortie, il figurait dans le top 7% des LLM de sa génération sur GPQA diamond. Ses connaissances s’arrêtent au 16 février 2026. Son niveau en code constitue son principal point fort, tandis que son contexte étendu ouvre la voie au traitement de volumes de texte particulièrement importants.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie9 juillet 2026
Connaissances jusqu'à2026-02-16
Multimodaloui
Fenêtre de contexte1 050 000 tokens (≈ 1,1 M)
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index57.72ᵉ / 137
Code Index78.31ᵉ / 74
Agentic Index51.82ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: OTIS Mock AIME 2024-2025100,0 %1ᵉ / 64epoch✅ Mesuré
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 161benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : Hallucinations (Baseline)98,0 %47ᵉ / 146benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)98,0 %16ᵉ / 155benchable✅ Mesuré
Benchable : Mathematics (Baseline)96,0 %8ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)95,0 %17ᵉ / 162benchable✅ Mesuré
Epoch: GPQA diamond93,5 %3ᵉ / 85epoch✅ Mesuré
Benchable : Instruction Following (Baseline)91,0 %8ᵉ / 163benchable✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private89,1 %1ᵉ / 17epoch✅ Mesuré
PinchBench : agentique (OpenClaw, 147 tâches)84,2 %4ᵉ / 19pinchbench✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private82,9 %1ᵉ / 18epoch✅ Mesuré
Epoch: SimpleQA Verified71,6 %2ᵉ / 26epoch✅ Mesuré
Epoch: Chess Puzzles64,0 %1ᵉ / 20epoch✅ Mesuré
Epoch: EBR-bench39,7 %1ᵉ / 7epoch✅ Mesuré
Connectors100,0 %1ᵉ / 3llm-statsAuto-déclaré
Capture-the-Flag Challenges (Internal)96,7 %1ᵉ / 3llm-statsAuto-déclaré
HealthBench Consensus95,5 %1ᵉ / 4llm-statsAuto-déclaré
GPQA94,6 %1ᵉ / 219llm-statsAuto-déclaré
MRCR v2 (8-needle)91,5 %1ᵉ / 19llm-statsAuto-déclaré
Search and Function-Calling91,0 %2ᵉ / 3llm-statsAuto-déclaré
Graphwalks BFS >128k90,7 %1ᵉ / 11llm-statsAuto-déclaré
BrowseComp90,4 %2ᵉ / 57llm-statsAuto-déclaré
FrontierMath89,0 %1ᵉ / 16llm-statsAuto-déclaré
Terminal-Bench 2.188,8 %1ᵉ / 13llm-statsAuto-déclaré
MMMU-Pro (with tools)84,6 %1ᵉ / 4llm-statsAuto-déclaré
BenchCAD (with Python tool)83,4 %1ᵉ / 3llm-statsAuto-déclaré
FrontierMath Tier 4 (v2)83,0 %1ᵉ / 3llm-statsAuto-déclaré
MMMU-Pro83,0 %3ᵉ / 64llm-statsAuto-déclaré
Artificial Analysis Coding Agent Index v1.180,0 %1ᵉ / 4llm-statsAuto-déclaré
Graphwalks BFS 1M77,1 %1ᵉ / 3llm-statsAuto-déclaré
MRCR v2 (8-needle, 512K-1M)73,8 %1ᵉ / 3llm-statsAuto-déclaré
ExploitBench73,5 %2ᵉ / 4llm-statsAuto-déclaré
DeepSWE72,7 %1ᵉ / 9llm-statsAuto-déclaré
SEC-bench Pro71,2 %1ᵉ / 3llm-statsAuto-déclaré
BenchCAD70,6 %1ᵉ / 4llm-statsAuto-déclaré
Internal Research Debugging Evaluation68,3 %1ᵉ / 3llm-statsAuto-déclaré
SWE-Bench Pro64,6 %5ᵉ / 41llm-statsAuto-déclaré
OSWorld 2.062,6 %1ᵉ / 3llm-statsAuto-déclaré
KernelGen 1P61,1 %1ᵉ / 3llm-statsAuto-déclaré
HealthBench Professional60,5 %2ᵉ / 8llm-statsAuto-déclaré
LifeSciBench59,9 %1ᵉ / 3llm-statsAuto-déclaré
Artificial Analysis59,0 %1ᵉ / 5llm-statsn.d.
GDPval-AA58,3 %2ᵉ / 39llm-statsAuto-déclaré
Toolathlon58,0 %4ᵉ / 30llm-statsAuto-déclaré
RSI Index57,9 %1ᵉ / 3llm-statsAuto-déclaré
HealthBench57,0 %3ᵉ / 8llm-statsAuto-déclaré
Big Finance Bench53,0 %1ᵉ / 3llm-statsAuto-déclaré
Agents' Last Exam52,7 %1ᵉ / 4llm-statsAuto-déclaré
PostTrainBench Lite50,3 %2ᵉ / 3llm-statsAuto-déclaré
MedChemBench (Internal)48,3 %1ᵉ / 3llm-statsAuto-déclaré
Management Consulting Tasks (Internal)43,2 %1ᵉ / 3llm-statsAuto-déclaré
ExploitGym33,7 %1ᵉ / 3llm-statsAuto-déclaré
HealthBench Hard33,1 %2ᵉ / 9llm-statsAuto-déclaré
GDP.pdf30,7 %2ᵉ / 5llm-statsAuto-déclaré
GeneBench-Pro28,7 %1ᵉ / 3llm-statsAuto-déclaré
AutomationBench18,1 %2ᵉ / 6llm-statsAuto-déclaré
NanoGPT9,7 %2ᵉ / 3llm-statsAuto-déclaré
ARC-AGI-37,8 %1ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ GPT-5.6 Sol57.7

Code Index

▶ GPT-5.6 Sol78.3

Classements Arena (Elo)

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
4ᵉGLM-5.21587
5ᵉClaude Opus 4.81562

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
8ᵉGemini 3 Pro1486
9ᵉKimi K31486
10ᵉGPT-5.6 Sol1486
11ᵉGemini 3.1 Pro Preview1485
12ᵉClaude Opus 4.81483

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI5 $30 $0,5 $
openai5 $30 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 140 % au-dessus de la moyenne des LLM similaires, et 1,2 fois plus cher que les modèles frontières (Claude Fable 5, Gemini 3.5 Flash, Mistral Medium 3.5).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)69,23 $
Durée d'exécution — PinchBench4 h 25 min
Indice valeur/coût — PinchBench1,33
Coût moyen par benchmark — Benchable0,2 $
Latence moyenne par benchmark — Benchable2 min 26 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. GPT-5.6 Sol occupe la première place du Code Index, tandis que ses Intelligence Index et Agentic Index le classent parmi les tout meilleurs modèles évalués. Il obtient aussi la première place sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée. Dans l’Arena Code, il est troisième derrière Kimi K3 et Claude Fable 5, mais devant GLM-5.2. Kimi K3 reste nettement devant en duel. Dans l’Arena text, GPT-5.6 Sol est dixième, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. GPT-5.6 Sol et Claude Fable 5 sont proches.

Limites et points d’attention. Les résultats Benchable sont peu discriminants car ces tests sont plafonnés. En General Knowledge et Ethics, GPT-5.6 Sol partage notamment la première place avec de nombreux modèles. Sur Hallucinations, son score de 98% correspond seulement à une 47e place partagée. Le tarif est premium, 140% au-dessus de la moyenne des LLM similaires et environ 1,2 fois supérieur à celui des modèles frontière. GPT-5.6 Sol cible surtout les usages exigeants en code, en mathématiques, en tâches agentiques ou en contexte très long, lorsque ce surcoût reste acceptable.


Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).