GPT-5.6 Terra

GPT-5.6 Terra est un LLM propriétaire d’OpenAI sorti le 9 juillet 2026. À son lancement, il figurait dans le top 11 % des LLM de sa génération sur GPQA diamond. Sa fenêtre de contexte de 1 050 000 tokens constitue l’un de ses principaux traits distinctifs.

GPT-5.6 Terra est un LLM propriétaire d’OpenAI sorti le 9 juillet 2026. À son lancement, il figurait dans le top 11 % des LLM de sa génération sur GPQA diamond. Sa fenêtre de contexte de 1 050 000 tokens constitue l’un de ses principaux traits distinctifs.

Le modèle associe de bons résultats généraux, mathématiques et agentiques à un positionnement tarifaire économique. Ses tarifs restent 20 % supérieurs à la moyenne des LLM similaires, mais environ 2,2 fois inférieurs à ceux des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie9 juillet 2026
Connaissances jusqu'à2026-02-16
Multimodaloui
Fenêtre de contexte1 050 000 tokens (≈ 1,1 M)
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index49.09ᵉ / 137
Code Index67.111ᵉ / 74
Agentic Index41.38ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 161benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-202599,7 %2ᵉ / 64epoch✅ Mesuré
Benchable : Ethics (Baseline)99,0 %73ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)98,0 %16ᵉ / 155benchable✅ Mesuré
Benchable : Hallucinations (Baseline)96,0 %67ᵉ / 146benchable✅ Mesuré
Benchable : Coding (Baseline)95,0 %17ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)94,0 %30ᵉ / 140benchable✅ Mesuré
Epoch: GPQA diamond93,3 %5ᵉ / 85epoch✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private86,0 %2ᵉ / 17epoch✅ Mesuré
Benchable : Instruction Following (Baseline)81,0 %28ᵉ / 163benchable✅ Mesuré
PinchBench : agentique (OpenClaw, 147 tâches)75,9 %8ᵉ / 19pinchbench✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private70,7 %3ᵉ / 18epoch✅ Mesuré
Epoch: Chess Puzzles54,0 %4ᵉ / 20epoch✅ Mesuré
Epoch: SimpleQA Verified43,1 %11ᵉ / 26epoch✅ Mesuré
Connectors100,0 %1ᵉ / 3llm-statsAuto-déclaré
HealthBench Consensus95,1 %2ᵉ / 4llm-statsAuto-déclaré
Search and Function-Calling94,6 %1ᵉ / 3llm-statsAuto-déclaré
GPQA92,9 %10ᵉ / 219llm-statsAuto-déclaré
Capture-the-Flag Challenges (Internal)91,8 %2ᵉ / 3llm-statsAuto-déclaré
MRCR v2 (8-needle)89,6 %2ᵉ / 19llm-statsAuto-déclaré
BrowseComp87,5 %4ᵉ / 57llm-statsAuto-déclaré
Terminal-Bench 2.187,4 %3ᵉ / 13llm-statsAuto-déclaré
FrontierMath84,9 %2ᵉ / 16llm-statsAuto-déclaré
MMMU-Pro (with tools)82,0 %3ᵉ / 4llm-statsAuto-déclaré
MMMU-Pro80,7 %10ᵉ / 64llm-statsAuto-déclaré
BenchCAD (with Python tool)78,2 %2ᵉ / 3llm-statsAuto-déclaré
Artificial Analysis Coding Agent Index v1.177,4 %2ᵉ / 4llm-statsAuto-déclaré
Graphwalks BFS >128k76,9 %4ᵉ / 11llm-statsAuto-déclaré
MRCR v2 (8-needle, 512K-1M)72,5 %2ᵉ / 3llm-statsAuto-déclaré
Graphwalks BFS 1M71,2 %2ᵉ / 3llm-statsAuto-déclaré
DeepSWE69,6 %2ᵉ / 9llm-statsAuto-déclaré
FrontierMath Tier 4 (v2)68,3 %2ᵉ / 3llm-statsAuto-déclaré
Internal Research Debugging Evaluation67,8 %2ᵉ / 3llm-statsAuto-déclaré
SWE-Bench Pro63,4 %7ᵉ / 41llm-statsAuto-déclaré
BenchCAD62,3 %3ᵉ / 4llm-statsAuto-déclaré
HealthBench Professional57,7 %4ᵉ / 8llm-statsAuto-déclaré
SEC-bench Pro57,7 %2ᵉ / 3llm-statsAuto-déclaré
HealthBench57,0 %3ᵉ / 8llm-statsAuto-déclaré
RSI Index56,3 %2ᵉ / 3llm-statsAuto-déclaré
LifeSciBench56,0 %2ᵉ / 3llm-statsAuto-déclaré
Artificial Analysis55,0 %2ᵉ / 5llm-statsn.d.
GDPval-AA53,1 %7ᵉ / 39llm-statsAuto-déclaré
Toolathlon53,1 %10ᵉ / 30llm-statsAuto-déclaré
ExploitBench52,9 %3ᵉ / 4llm-statsAuto-déclaré
PostTrainBench Lite51,5 %1ᵉ / 3llm-statsAuto-déclaré
Big Finance Bench51,0 %2ᵉ / 3llm-statsAuto-déclaré
Agents' Last Exam50,4 %2ᵉ / 4llm-statsAuto-déclaré
OSWorld 2.050,2 %2ᵉ / 3llm-statsAuto-déclaré
KernelGen 1P49,2 %2ᵉ / 3llm-statsAuto-déclaré
Management Consulting Tasks (Internal)37,2 %2ᵉ / 3llm-statsAuto-déclaré
MedChemBench (Internal)35,0 %2ᵉ / 3llm-statsAuto-déclaré
HealthBench Hard32,7 %3ᵉ / 9llm-statsAuto-déclaré
GDP.pdf24,7 %4ᵉ / 5llm-statsAuto-déclaré
GeneBench-Pro23,3 %2ᵉ / 3llm-statsAuto-déclaré
ExploitGym23,2 %2ᵉ / 3llm-statsAuto-déclaré
AutomationBench15,2 %4ᵉ / 6llm-statsAuto-déclaré
NanoGPT14,5 %1ᵉ / 3llm-statsAuto-déclaré
ARC-AGI-30,8 %2ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ GPT-5.6 Terra49.0
DeepSeek V4 Pro40.8

Code Index

▶ GPT-5.6 Terra67.1

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Azure2,5 $15 $0,25 $
openai2,5 $15 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 20 % au-dessus de la moyenne des LLM similaires, et 2,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)27,47 $
Durée d'exécution — PinchBench2 h 32 min
Indice valeur/coût — PinchBench3,38
Coût moyen par benchmark — Benchable0,1 $
Latence moyenne par benchmark — Benchable1 min 47 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. GPT-5.6 Terra se place dans le top 10 de l’Intelligence Index et de l’Agentic Index, ce qui le situe parmi les modèles les plus solides pour les tâches générales et agentiques. Il atteint aussi la deuxième place sur Epoch: OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée. Son Code Index le classe juste hors du top 10. La fenêtre de 1 050 000 tokens autorise le maintien d’un volume particulièrement important d’informations dans un même contexte.

Limites et points d’attention. Les résultats Benchable sont peu discriminants. Sur General Knowledge, le score maximal est partagé avec 41 autres modèles. Les baselines Ethics, Email Classification, Reasoning et Hallucinations sont également plafonnées et donnent lieu à de nombreux ex æquo. Elles ne suffisent donc pas à établir un avantage net. Le modèle est propriétaire et son tarif dépasse de 20 % celui des LLM similaires, malgré un coût nettement inférieur à celui des modèles frontière. Ce profil convient surtout aux usages exigeant un long contexte, de bonnes aptitudes mathématiques, du code et des capacités agentiques.


Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).