GPT-5.6 Terra
GPT-5.6 Terra est un LLM propriétaire d’OpenAI sorti le 9 juillet 2026. À son lancement, il figurait dans le top 11 % des LLM de sa génération sur GPQA diamond. Sa fenêtre de contexte de 1 050 000 tokens constitue l’un de ses principaux traits distinctifs.
GPT-5.6 Terra est un LLM propriétaire d’OpenAI sorti le 9 juillet 2026. À son lancement, il figurait dans le top 11 % des LLM de sa génération sur GPQA diamond. Sa fenêtre de contexte de 1 050 000 tokens constitue l’un de ses principaux traits distinctifs.
Le modèle associe de bons résultats généraux, mathématiques et agentiques à un positionnement tarifaire économique. Ses tarifs restent 20 % supérieurs à la moyenne des LLM similaires, mais environ 2,2 fois inférieurs à ceux des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 9 juillet 2026 |
| Connaissances jusqu'à | 2026-02-16 |
| Multimodal | oui |
| Fenêtre de contexte | 1 050 000 tokens (≈ 1,1 M) |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 49.0 | 9ᵉ / 137 |
| Code Index | 67.1 | 11ᵉ / 74 |
| Agentic Index | 41.3 | 8ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 99,7 % | 2ᵉ / 64 | epoch | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 99,0 % | 73ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 98,0 % | 16ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 96,0 % | 67ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 95,0 % | 17ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 94,0 % | 30ᵉ / 140 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 93,3 % | 5ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 86,0 % | 2ᵉ / 17 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 81,0 % | 28ᵉ / 163 | benchable | ✅ Mesuré |
| PinchBench : agentique (OpenClaw, 147 tâches) | 75,9 % | 8ᵉ / 19 | pinchbench | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 70,7 % | 3ᵉ / 18 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 54,0 % | 4ᵉ / 20 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 43,1 % | 11ᵉ / 26 | epoch | ✅ Mesuré |
| Connectors | 100,0 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| HealthBench Consensus | 95,1 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| Search and Function-Calling | 94,6 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| GPQA | 92,9 % | 10ᵉ / 219 | llm-stats | Auto-déclaré |
| Capture-the-Flag Challenges (Internal) | 91,8 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| MRCR v2 (8-needle) | 89,6 % | 2ᵉ / 19 | llm-stats | Auto-déclaré |
| BrowseComp | 87,5 % | 4ᵉ / 57 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.1 | 87,4 % | 3ᵉ / 13 | llm-stats | Auto-déclaré |
| FrontierMath | 84,9 % | 2ᵉ / 16 | llm-stats | Auto-déclaré |
| MMMU-Pro (with tools) | 82,0 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| MMMU-Pro | 80,7 % | 10ᵉ / 64 | llm-stats | Auto-déclaré |
| BenchCAD (with Python tool) | 78,2 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| Artificial Analysis Coding Agent Index v1.1 | 77,4 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| Graphwalks BFS >128k | 76,9 % | 4ᵉ / 11 | llm-stats | Auto-déclaré |
| MRCR v2 (8-needle, 512K-1M) | 72,5 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| Graphwalks BFS 1M | 71,2 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| DeepSWE | 69,6 % | 2ᵉ / 9 | llm-stats | Auto-déclaré |
| FrontierMath Tier 4 (v2) | 68,3 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| Internal Research Debugging Evaluation | 67,8 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 63,4 % | 7ᵉ / 41 | llm-stats | Auto-déclaré |
| BenchCAD | 62,3 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| HealthBench Professional | 57,7 % | 4ᵉ / 8 | llm-stats | Auto-déclaré |
| SEC-bench Pro | 57,7 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| HealthBench | 57,0 % | 3ᵉ / 8 | llm-stats | Auto-déclaré |
| RSI Index | 56,3 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| LifeSciBench | 56,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| Artificial Analysis | 55,0 % | 2ᵉ / 5 | llm-stats | n.d. |
| GDPval-AA | 53,1 % | 7ᵉ / 39 | llm-stats | Auto-déclaré |
| Toolathlon | 53,1 % | 10ᵉ / 30 | llm-stats | Auto-déclaré |
| ExploitBench | 52,9 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| PostTrainBench Lite | 51,5 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| Big Finance Bench | 51,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| Agents' Last Exam | 50,4 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| OSWorld 2.0 | 50,2 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| KernelGen 1P | 49,2 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| Management Consulting Tasks (Internal) | 37,2 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| MedChemBench (Internal) | 35,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| HealthBench Hard | 32,7 % | 3ᵉ / 9 | llm-stats | Auto-déclaré |
| GDP.pdf | 24,7 % | 4ᵉ / 5 | llm-stats | Auto-déclaré |
| GeneBench-Pro | 23,3 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| ExploitGym | 23,2 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| AutomationBench | 15,2 % | 4ᵉ / 6 | llm-stats | Auto-déclaré |
| NanoGPT | 14,5 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| ARC-AGI-3 | 0,8 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Azure | 2,5 $ | 15 $ | 0,25 $ |
| openai | 2,5 $ | 15 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 20 % au-dessus de la moyenne des LLM similaires, et 2,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 27,47 $ |
| Durée d'exécution — PinchBench | 2 h 32 min |
| Indice valeur/coût — PinchBench | 3,38 |
| Coût moyen par benchmark — Benchable | 0,1 $ |
| Latence moyenne par benchmark — Benchable | 1 min 47 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. GPT-5.6 Terra se place dans le top 10 de l’Intelligence Index et de l’Agentic Index, ce qui le situe parmi les modèles les plus solides pour les tâches générales et agentiques. Il atteint aussi la deuxième place sur Epoch: OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée. Son Code Index le classe juste hors du top 10. La fenêtre de 1 050 000 tokens autorise le maintien d’un volume particulièrement important d’informations dans un même contexte.
Limites et points d’attention. Les résultats Benchable sont peu discriminants. Sur General Knowledge, le score maximal est partagé avec 41 autres modèles. Les baselines Ethics, Email Classification, Reasoning et Hallucinations sont également plafonnées et donnent lieu à de nombreux ex æquo. Elles ne suffisent donc pas à établir un avantage net. Le modèle est propriétaire et son tarif dépasse de 20 % celui des LLM similaires, malgré un coût nettement inférieur à celui des modèles frontière. Ce profil convient surtout aux usages exigeant un long contexte, de bonnes aptitudes mathématiques, du code et des capacités agentiques.
Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).