OpenAI: GPT-5.6 Luna Pro
OpenAI: GPT-5.6 Luna Pro est un LLM propriétaire lancé le 9 juillet 2026. Sa fenêtre de contexte de 1 050 000 tokens constitue son principal trait distinctif et autorise le traitement de très grands volumes de texte en entrée. Ses connaissances s'arrêtent au 16 février 2026.
OpenAI: GPT-5.6 Luna Pro est un LLM propriétaire lancé le 9 juillet 2026. Sa fenêtre de contexte de 1 050 000 tokens constitue son principal trait distinctif et autorise le traitement de très grands volumes de texte en entrée. Ses connaissances s'arrêtent au 16 février 2026.
Le modèle combine ce contexte étendu avec un positionnement très économique. Les tarifs commencent à 1 $ par million de tokens en entrée et 6 $ en sortie. Les évaluations Benchable montrent des scores bruts élevés, avec un résultat particulièrement solide en Coding, mais plusieurs épreuves sont plafonnées et départagent mal les modèles.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 9 juillet 2026 |
| Connaissances jusqu'à | 2026-02-16 |
| Multimodal | oui |
| Fenêtre de contexte | 1 050 000 tokens (≈ 1,1 M) |
| Modalités (entrée → sortie) | file,image,text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 99,0 % | 73ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 98,0 % | 47ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 95,0 % | 17ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 94,0 % | 42ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 94,0 % | 30ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 86,9 % | 13ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : General Knowledge (Baseline)
Benchable : Ethics (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 1 $ | 6 $ | 0,1 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 52 % en dessous de la moyenne des LLM similaires, et 5,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,38 $ |
| Latence moyenne par benchmark — Benchable | 4 min 27 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. La fenêtre de 1 050 000 tokens convient aux tâches nécessitant un contexte particulièrement volumineux. Coding constitue le résultat Benchable le plus distinctif du modèle, qui se situe dans le haut du classement malgré une large égalité. Les scores bruts sont également élevés en General Knowledge, Hallucinations, Email Classification et Reasoning. Le prix renforce ce positionnement : la tarification se situe 52% sous la moyenne des LLM similaires et environ 5,5 fois sous celle des modèles frontière.
Limites et points d'attention. Les benchmarks Benchable sont plafonnés et leurs nombreux ex æquo réduisent fortement leur pouvoir discriminant. Sur General Knowledge, le score maximal est partagé avec 41 autres modèles. Coding est partagé avec 13 autres, tandis que Reasoning, Hallucinations et Email Classification occupent des positions moins élevées malgré leurs scores bruts. Ethics se situe au milieu du classement et partage sa place avec 30 autres modèles. Les connaissances s'arrêtent près de cinq mois avant la sortie, ce qui limite la couverture des événements les plus récents. Ce modèle propriétaire cible surtout les traitements à très long contexte et les usages sensibles au coût.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).