GPT-5.6 Luna
GPT-5.6 Luna est un LLM propriétaire d’OpenAI, sorti le 9 juillet 2026. Il se caractérise par une fenêtre de contexte de 1 050 000 tokens, des résultats particulièrement élevés en mathématiques et un positionnement tarifaire très économique. Ses connaissances s’arrêtent au 16 février 2026.
GPT-5.6 Luna est un LLM propriétaire d’OpenAI, sorti le 9 juillet 2026. Il se caractérise par une fenêtre de contexte de 1 050 000 tokens, des résultats particulièrement élevés en mathématiques et un positionnement tarifaire très économique. Ses connaissances s’arrêtent au 16 février 2026.
À sa sortie, le modèle figurait dans le top 13% des LLM de sa génération sur GPQA diamond. Son tarif se situe 52% sous la moyenne des modèles similaires et environ 5,5 fois sous celui des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 9 juillet 2026 |
| Connaissances jusqu'à | 2026-02-16 |
| Multimodal | oui |
| Fenêtre de contexte | 1 050 000 tokens (≈ 1,1 M) |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 38.1 | 29ᵉ / 137 |
| Code Index | 50.7 | 32ᵉ / 74 |
| Agentic Index | 31.0 | 16ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 99,0 % | 73ᵉ / 159 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 98,3 % | 3ᵉ / 64 | epoch | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 98,0 % | 47ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 95,0 % | 17ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 94,0 % | 30ᵉ / 140 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 91,6 % | 6ᵉ / 85 | epoch | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 90,0 % | 53ᵉ / 155 | benchable | ✅ Mesuré |
| PinchBench : agentique (OpenClaw, 147 tâches) | 88,7 % | 2ᵉ / 19 | pinchbench | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 82,1 % | 4ᵉ / 17 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 81,0 % | 28ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 61,0 % | 4ᵉ / 18 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 41,7 % | 13ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 40,0 % | 6ᵉ / 20 | epoch | ✅ Mesuré |
| Connectors | 99,9 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| HealthBench Consensus | 95,1 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| GPQA | 92,3 % | 13ᵉ / 219 | llm-stats | Auto-déclaré |
| Search and Function-Calling | 89,7 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| Capture-the-Flag Challenges (Internal) | 85,2 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.1 | 84,7 % | 4ᵉ / 13 | llm-stats | Auto-déclaré |
| BrowseComp | 83,3 % | 17ᵉ / 57 | llm-stats | Auto-déclaré |
| Graphwalks BFS >128k | 81,3 % | 2ᵉ / 11 | llm-stats | Auto-déclaré |
| MMMU-Pro (with tools) | 79,5 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| FrontierMath | 78,6 % | 3ᵉ / 16 | llm-stats | Auto-déclaré |
| MMMU-Pro | 78,4 % | 18ᵉ / 64 | llm-stats | Auto-déclaré |
| Artificial Analysis Coding Agent Index v1.1 | 74,6 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| BenchCAD (with Python tool) | 73,9 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| DeepSWE | 67,2 % | 4ᵉ / 9 | llm-stats | Auto-déclaré |
| BenchCAD | 63,1 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 62,7 % | 9ᵉ / 41 | llm-stats | Auto-déclaré |
| FrontierMath Tier 4 (v2) | 58,5 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| HealthBench | 55,8 % | 5ᵉ / 8 | llm-stats | Auto-déclaré |
| HealthBench Professional | 55,7 % | 6ᵉ / 8 | llm-stats | Auto-déclaré |
| Toolathlon | 53,4 % | 9ᵉ / 30 | llm-stats | Auto-déclaré |
| GDPval-AA | 53,1 % | 8ᵉ / 39 | llm-stats | Auto-déclaré |
| Graphwalks BFS 1M | 51,2 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| LifeSciBench | 51,2 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| Artificial Analysis | 51,0 % | 4ᵉ / 5 | llm-stats | n.d. |
| Internal Research Debugging Evaluation | 50,8 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| Agents' Last Exam | 50,3 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| SEC-bench Pro | 48,9 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| OSWorld 2.0 | 45,6 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| RSI Index | 41,9 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| MRCR v2 (8-needle) | 41,3 % | 9ᵉ / 19 | llm-stats | Auto-déclaré |
| MRCR v2 (8-needle, 512K-1M) | 41,3 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| Big Finance Bench | 36,0 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| Management Consulting Tasks (Internal) | 35,4 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| ExploitBench | 33,2 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| HealthBench Hard | 32,0 % | 4ᵉ / 9 | llm-stats | Auto-déclaré |
| MedChemBench (Internal) | 30,4 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| PostTrainBench Lite | 29,6 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| GDP.pdf | 22,7 % | 5ᵉ / 5 | llm-stats | Auto-déclaré |
| KernelGen 1P | 22,4 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| AutomationBench | 14,9 % | 5ᵉ / 6 | llm-stats | Auto-déclaré |
| ExploitGym | 12,4 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| GeneBench-Pro | 10,8 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| NanoGPT | 1,7 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| ARC-AGI-3 | 0,2 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 1 $ | 6 $ | 0,1 $ |
| openai | 1 $ | 6 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 52 % en dessous de la moyenne des LLM similaires, et 5,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 17,14 $ |
| Durée d'exécution — PinchBench | 2 h 50 min |
| Indice valeur/coût — PinchBench | 6,32 |
| Coût moyen par benchmark — Benchable | 0,05 $ |
| Latence moyenne par benchmark — Benchable | 2 min 00 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. GPT-5.6 Luna se distingue en mathématiques de niveau lycée : il occupe la troisième place sur OTIS Mock AIME 2024-2025, dans le top 10. À sa sortie, son classement sur GPQA diamond le plaçait dans le haut du panier de sa génération. L’Intelligence Index et l’Agentic Index le situent tous deux dans le premier quart de leurs classements respectifs. Sa fenêtre de 1 050 000 tokens autorise l’entrée de volumes de texte très importants. Ce contexte étendu s’accompagne d’un prix nettement inférieur à la moyenne des LLM similaires.
Limites et points d’attention. Le Code Index place GPT-5.6 Luna en milieu de tableau, loin des premières positions. Les scores Benchable apportent peu de hiérarchie : en Coding, le modèle partage la 17e place avec 13 autres modèles, tandis qu’en General Knowledge il partage la première avec 41 autres. Ces benchmarks plafonnés ne départagent donc pas clairement les concurrents. Le résultat Hallucinations est lui aussi non discriminant, avec une 47e place partagée par 18 autres modèles. Enfin, son caractère propriétaire limite son ouverture. GPT-5.6 Luna convient surtout aux tâches mathématiques, aux traitements à très long contexte et aux usages sensibles au coût.
Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).