GPT-5.6 Luna

GPT-5.6 Luna est un LLM propriétaire d’OpenAI, sorti le 9 juillet 2026. Il se caractérise par une fenêtre de contexte de 1 050 000 tokens, des résultats particulièrement élevés en mathématiques et un positionnement tarifaire très économique. Ses connaissances s’arrêtent au 16 février 2026.

GPT-5.6 Luna est un LLM propriétaire d’OpenAI, sorti le 9 juillet 2026. Il se caractérise par une fenêtre de contexte de 1 050 000 tokens, des résultats particulièrement élevés en mathématiques et un positionnement tarifaire très économique. Ses connaissances s’arrêtent au 16 février 2026.

À sa sortie, le modèle figurait dans le top 13% des LLM de sa génération sur GPQA diamond. Son tarif se situe 52% sous la moyenne des modèles similaires et environ 5,5 fois sous celui des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie9 juillet 2026
Connaissances jusqu'à2026-02-16
Multimodaloui
Fenêtre de contexte1 050 000 tokens (≈ 1,1 M)
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index38.129ᵉ / 137
Code Index50.732ᵉ / 74
Agentic Index31.016ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 161benchable✅ Mesuré
Benchable : Ethics (Baseline)99,0 %73ᵉ / 159benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-202598,3 %3ᵉ / 64epoch✅ Mesuré
Benchable : Hallucinations (Baseline)98,0 %47ᵉ / 146benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)95,0 %17ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)94,0 %30ᵉ / 140benchable✅ Mesuré
Epoch: GPQA diamond91,6 %6ᵉ / 85epoch✅ Mesuré
Benchable : Reasoning (Baseline)90,0 %53ᵉ / 155benchable✅ Mesuré
PinchBench : agentique (OpenClaw, 147 tâches)88,7 %2ᵉ / 19pinchbench✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private82,1 %4ᵉ / 17epoch✅ Mesuré
Benchable : Instruction Following (Baseline)81,0 %28ᵉ / 163benchable✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private61,0 %4ᵉ / 18epoch✅ Mesuré
Epoch: SimpleQA Verified41,7 %13ᵉ / 26epoch✅ Mesuré
Epoch: Chess Puzzles40,0 %6ᵉ / 20epoch✅ Mesuré
Connectors99,9 %3ᵉ / 3llm-statsAuto-déclaré
HealthBench Consensus95,1 %2ᵉ / 4llm-statsAuto-déclaré
GPQA92,3 %13ᵉ / 219llm-statsAuto-déclaré
Search and Function-Calling89,7 %3ᵉ / 3llm-statsAuto-déclaré
Capture-the-Flag Challenges (Internal)85,2 %3ᵉ / 3llm-statsAuto-déclaré
Terminal-Bench 2.184,7 %4ᵉ / 13llm-statsAuto-déclaré
BrowseComp83,3 %17ᵉ / 57llm-statsAuto-déclaré
Graphwalks BFS >128k81,3 %2ᵉ / 11llm-statsAuto-déclaré
MMMU-Pro (with tools)79,5 %4ᵉ / 4llm-statsAuto-déclaré
FrontierMath78,6 %3ᵉ / 16llm-statsAuto-déclaré
MMMU-Pro78,4 %18ᵉ / 64llm-statsAuto-déclaré
Artificial Analysis Coding Agent Index v1.174,6 %4ᵉ / 4llm-statsAuto-déclaré
BenchCAD (with Python tool)73,9 %3ᵉ / 3llm-statsAuto-déclaré
DeepSWE67,2 %4ᵉ / 9llm-statsAuto-déclaré
BenchCAD63,1 %2ᵉ / 4llm-statsAuto-déclaré
SWE-Bench Pro62,7 %9ᵉ / 41llm-statsAuto-déclaré
FrontierMath Tier 4 (v2)58,5 %3ᵉ / 3llm-statsAuto-déclaré
HealthBench55,8 %5ᵉ / 8llm-statsAuto-déclaré
HealthBench Professional55,7 %6ᵉ / 8llm-statsAuto-déclaré
Toolathlon53,4 %9ᵉ / 30llm-statsAuto-déclaré
GDPval-AA53,1 %8ᵉ / 39llm-statsAuto-déclaré
Graphwalks BFS 1M51,2 %3ᵉ / 3llm-statsAuto-déclaré
LifeSciBench51,2 %3ᵉ / 3llm-statsAuto-déclaré
Artificial Analysis51,0 %4ᵉ / 5llm-statsn.d.
Internal Research Debugging Evaluation50,8 %3ᵉ / 3llm-statsAuto-déclaré
Agents' Last Exam50,3 %3ᵉ / 4llm-statsAuto-déclaré
SEC-bench Pro48,9 %3ᵉ / 3llm-statsAuto-déclaré
OSWorld 2.045,6 %3ᵉ / 3llm-statsAuto-déclaré
RSI Index41,9 %3ᵉ / 3llm-statsAuto-déclaré
MRCR v2 (8-needle)41,3 %9ᵉ / 19llm-statsAuto-déclaré
MRCR v2 (8-needle, 512K-1M)41,3 %3ᵉ / 3llm-statsAuto-déclaré
Big Finance Bench36,0 %3ᵉ / 3llm-statsAuto-déclaré
Management Consulting Tasks (Internal)35,4 %3ᵉ / 3llm-statsAuto-déclaré
ExploitBench33,2 %4ᵉ / 4llm-statsAuto-déclaré
HealthBench Hard32,0 %4ᵉ / 9llm-statsAuto-déclaré
MedChemBench (Internal)30,4 %3ᵉ / 3llm-statsAuto-déclaré
PostTrainBench Lite29,6 %3ᵉ / 3llm-statsAuto-déclaré
GDP.pdf22,7 %5ᵉ / 5llm-statsAuto-déclaré
KernelGen 1P22,4 %3ᵉ / 3llm-statsAuto-déclaré
AutomationBench14,9 %5ᵉ / 6llm-statsAuto-déclaré
ExploitGym12,4 %3ᵉ / 3llm-statsAuto-déclaré
GeneBench-Pro10,8 %3ᵉ / 3llm-statsAuto-déclaré
NanoGPT1,7 %3ᵉ / 3llm-statsAuto-déclaré
ARC-AGI-30,2 %3ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Grok Build 0.1 061639.8
▶ GPT-5.6 Luna38.1
Nemotron 3 Ultra 550B A…37.8

Code Index

Grok Build 0.1 061651.5
▶ GPT-5.6 Luna50.7
Nemotron 3 Ultra 550B A…49.3

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI1 $6 $0,1 $
openai1 $6 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 52 % en dessous de la moyenne des LLM similaires, et 5,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)17,14 $
Durée d'exécution — PinchBench2 h 50 min
Indice valeur/coût — PinchBench6,32
Coût moyen par benchmark — Benchable0,05 $
Latence moyenne par benchmark — Benchable2 min 00 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. GPT-5.6 Luna se distingue en mathématiques de niveau lycée : il occupe la troisième place sur OTIS Mock AIME 2024-2025, dans le top 10. À sa sortie, son classement sur GPQA diamond le plaçait dans le haut du panier de sa génération. L’Intelligence Index et l’Agentic Index le situent tous deux dans le premier quart de leurs classements respectifs. Sa fenêtre de 1 050 000 tokens autorise l’entrée de volumes de texte très importants. Ce contexte étendu s’accompagne d’un prix nettement inférieur à la moyenne des LLM similaires.

Limites et points d’attention. Le Code Index place GPT-5.6 Luna en milieu de tableau, loin des premières positions. Les scores Benchable apportent peu de hiérarchie : en Coding, le modèle partage la 17e place avec 13 autres modèles, tandis qu’en General Knowledge il partage la première avec 41 autres. Ces benchmarks plafonnés ne départagent donc pas clairement les concurrents. Le résultat Hallucinations est lui aussi non discriminant, avec une 47e place partagée par 18 autres modèles. Enfin, son caractère propriétaire limite son ouverture. GPT-5.6 Luna convient surtout aux tâches mathématiques, aux traitements à très long contexte et aux usages sensibles au coût.


Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).