GPT-5.6 Sol
GPT-5.6 Sol est un LLM propriétaire d’OpenAI, lancé le 9 juillet 2026. Ce modèle premium se distingue par une fenêtre de contexte de 1 050 000 tokens et par son positionnement de premier plan en programmation, en mathématiques et dans les tâches agentiques.
GPT-5.6 Sol est un LLM propriétaire d’OpenAI, lancé le 9 juillet 2026. Ce modèle premium se distingue par une fenêtre de contexte de 1 050 000 tokens et par son positionnement de premier plan en programmation, en mathématiques et dans les tâches agentiques.
À sa sortie, il figurait dans le top 7% des LLM de sa génération sur GPQA diamond. Ses connaissances s’arrêtent au 16 février 2026. Son niveau en code constitue son principal point fort, tandis que son contexte étendu ouvre la voie au traitement de volumes de texte particulièrement importants.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 9 juillet 2026 |
| Connaissances jusqu'à | 2026-02-16 |
| Multimodal | oui |
| Fenêtre de contexte | 1 050 000 tokens (≈ 1,1 M) |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 57.7 | 2ᵉ / 137 |
| Code Index | 78.3 | 1ᵉ / 74 |
| Agentic Index | 51.8 | 2ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: OTIS Mock AIME 2024-2025 | 100,0 % | 1ᵉ / 64 | epoch | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 98,0 % | 47ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 98,0 % | 16ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 96,0 % | 8ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 95,0 % | 17ᵉ / 162 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 93,5 % | 3ᵉ / 85 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 91,0 % | 8ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 89,1 % | 1ᵉ / 17 | epoch | ✅ Mesuré |
| PinchBench : agentique (OpenClaw, 147 tâches) | 84,2 % | 4ᵉ / 19 | pinchbench | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 82,9 % | 1ᵉ / 18 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 71,6 % | 2ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 64,0 % | 1ᵉ / 20 | epoch | ✅ Mesuré |
| Epoch: EBR-bench | 39,7 % | 1ᵉ / 7 | epoch | ✅ Mesuré |
| Connectors | 100,0 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| Capture-the-Flag Challenges (Internal) | 96,7 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| HealthBench Consensus | 95,5 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| GPQA | 94,6 % | 1ᵉ / 219 | llm-stats | Auto-déclaré |
| MRCR v2 (8-needle) | 91,5 % | 1ᵉ / 19 | llm-stats | Auto-déclaré |
| Search and Function-Calling | 91,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| Graphwalks BFS >128k | 90,7 % | 1ᵉ / 11 | llm-stats | Auto-déclaré |
| BrowseComp | 90,4 % | 2ᵉ / 57 | llm-stats | Auto-déclaré |
| FrontierMath | 89,0 % | 1ᵉ / 16 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.1 | 88,8 % | 1ᵉ / 13 | llm-stats | Auto-déclaré |
| MMMU-Pro (with tools) | 84,6 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| BenchCAD (with Python tool) | 83,4 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| FrontierMath Tier 4 (v2) | 83,0 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| MMMU-Pro | 83,0 % | 3ᵉ / 64 | llm-stats | Auto-déclaré |
| Artificial Analysis Coding Agent Index v1.1 | 80,0 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| Graphwalks BFS 1M | 77,1 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| MRCR v2 (8-needle, 512K-1M) | 73,8 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| ExploitBench | 73,5 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| DeepSWE | 72,7 % | 1ᵉ / 9 | llm-stats | Auto-déclaré |
| SEC-bench Pro | 71,2 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| BenchCAD | 70,6 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| Internal Research Debugging Evaluation | 68,3 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 64,6 % | 5ᵉ / 41 | llm-stats | Auto-déclaré |
| OSWorld 2.0 | 62,6 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| KernelGen 1P | 61,1 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| HealthBench Professional | 60,5 % | 2ᵉ / 8 | llm-stats | Auto-déclaré |
| LifeSciBench | 59,9 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| Artificial Analysis | 59,0 % | 1ᵉ / 5 | llm-stats | n.d. |
| GDPval-AA | 58,3 % | 2ᵉ / 39 | llm-stats | Auto-déclaré |
| Toolathlon | 58,0 % | 4ᵉ / 30 | llm-stats | Auto-déclaré |
| RSI Index | 57,9 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| HealthBench | 57,0 % | 3ᵉ / 8 | llm-stats | Auto-déclaré |
| Big Finance Bench | 53,0 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| Agents' Last Exam | 52,7 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| PostTrainBench Lite | 50,3 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| MedChemBench (Internal) | 48,3 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| Management Consulting Tasks (Internal) | 43,2 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| ExploitGym | 33,7 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| HealthBench Hard | 33,1 % | 2ᵉ / 9 | llm-stats | Auto-déclaré |
| GDP.pdf | 30,7 % | 2ᵉ / 5 | llm-stats | Auto-déclaré |
| GeneBench-Pro | 28,7 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| AutomationBench | 18,1 % | 2ᵉ / 6 | llm-stats | Auto-déclaré |
| NanoGPT | 9,7 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| ARC-AGI-3 | 7,8 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| 4ᵉ | GLM-5.2 | 1587 |
| 5ᵉ | Claude Opus 4.8 | 1562 |
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 8ᵉ | Gemini 3 Pro | 1486 |
| 9ᵉ | Kimi K3 | 1486 |
| 10ᵉ | GPT-5.6 Sol | 1486 |
| 11ᵉ | Gemini 3.1 Pro Preview | 1485 |
| 12ᵉ | Claude Opus 4.8 | 1483 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 5 $ | 30 $ | 0,5 $ |
| openai | 5 $ | 30 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 140 % au-dessus de la moyenne des LLM similaires, et 1,2 fois plus cher que les modèles frontières (Claude Fable 5, Gemini 3.5 Flash, Mistral Medium 3.5).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 69,23 $ |
| Durée d'exécution — PinchBench | 4 h 25 min |
| Indice valeur/coût — PinchBench | 1,33 |
| Coût moyen par benchmark — Benchable | 0,2 $ |
| Latence moyenne par benchmark — Benchable | 2 min 26 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. GPT-5.6 Sol occupe la première place du Code Index, tandis que ses Intelligence Index et Agentic Index le classent parmi les tout meilleurs modèles évalués. Il obtient aussi la première place sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée. Dans l’Arena Code, il est troisième derrière Kimi K3 et Claude Fable 5, mais devant GLM-5.2. Kimi K3 reste nettement devant en duel. Dans l’Arena text, GPT-5.6 Sol est dixième, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. GPT-5.6 Sol et Claude Fable 5 sont proches.
Limites et points d’attention. Les résultats Benchable sont peu discriminants car ces tests sont plafonnés. En General Knowledge et Ethics, GPT-5.6 Sol partage notamment la première place avec de nombreux modèles. Sur Hallucinations, son score de 98% correspond seulement à une 47e place partagée. Le tarif est premium, 140% au-dessus de la moyenne des LLM similaires et environ 1,2 fois supérieur à celui des modèles frontière. GPT-5.6 Sol cible surtout les usages exigeants en code, en mathématiques, en tâches agentiques ou en contexte très long, lorsque ce surcoût reste acceptable.
Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).