GPT-5 nano
GPT-5 nano est un LLM propriétaire lancé par l’éditeur américain OpenAI le 7 août 2025. Son positionnement associe une fenêtre de contexte de 400 000 tokens à une tarification très économique. Ses connaissances s’arrêtent au 30 mai 2024.
GPT-5 nano est un LLM propriétaire lancé par l’éditeur américain OpenAI le 7 août 2025. Son positionnement associe une fenêtre de contexte de 400 000 tokens à une tarification très économique. Ses connaissances s’arrêtent au 30 mai 2024.
À sa sortie, il figurait dans le top 19% des LLM de sa génération sur GPQA diamond. Son principal signe distinctif reste toutefois son coût : sa tarification se situe 98% sous la moyenne des LLM similaires et environ 110 fois sous celle des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 7 août 2025 |
| Connaissances jusqu'à | 2024-05-30 |
| Multimodal | oui |
| Fenêtre de contexte | 400 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 19.9 | 104ᵉ / 137 |
| Math Index | 83.7 | 17ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 98,0 % | 105ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 96,0 % | 32ᵉ / 155 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 95,2 % | 8ᵉ / 59 | epoch | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 94,0 % | 30ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 93,0 % | 42ᵉ / 162 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 81,1 % | 20ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 69,4 % | 31ᵉ / 85 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 69,0 % | 57ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 20,0 % | 16ᵉ / 17 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 20,0 % | 11ᵉ / 33 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 12,2 % | 24ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 8,3 % | 17ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 2,4 % | 15ᵉ / 18 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 2,1 % | 15ᵉ / 25 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Public | 0,0 % | 1ᵉ / 15 | epoch | ✅ Mesuré |
| AIME 2025 | 85,2 % | 55ᵉ / 108 | llm-stats | Auto-déclaré |
| HMMT 2025 | 75,6 % | 26ᵉ / 33 | llm-stats | Auto-déclaré |
| GPQA | 71,2 % | 112ᵉ / 219 | llm-stats | Auto-déclaré |
| FrontierMath | 9,6 % | 13ᵉ / 16 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 8,7 % | 81ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 196ᵉ | Gemma 3 12B | 1342 |
| 197ᵉ | hunyuan-turbo-0110 | 1341 |
| 198ᵉ | GPT-5 nano | 1337 |
| 199ᵉ | o1-mini | 1337 |
| 200ᵉ | Nova 2 Lite | 1337 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 87ᵉ | hunyuan-large-vision | 1149 |
| 88ᵉ | Llama 4 Maverick | 1146 |
| 89ᵉ | GPT-5 nano | 1146 |
| 90ᵉ | step-3 | 1145 |
| 91ᵉ | Claude 3.5 Sonnet | 1145 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 0,05 $ | 0,4 $ | 0,005 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 98 % en dessous de la moyenne des LLM similaires, et 110 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,03 $ |
| Latence moyenne par benchmark — Benchable | 8 min 09 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | United States of America |
Notre analyse
Forces. GPT-5 nano obtient ses résultats les plus solides en mathématiques. Epoch: MATH level 5 le place dans le top 10, tandis que son Math Index le situe dans le premier tiers du classement. Sa fenêtre de 400 000 tokens constitue un autre atout concret. Les scores maximaux en General Knowledge et Hallucinations sont partagés avec respectivement 41 et 45 autres modèles : ces benchmarks plafonnés confirment la réussite des tests, mais ne départagent pas réellement les concurrents.
Limites et points d’attention. L’Intelligence Index place GPT-5 nano en retrait du classement. Le constat est plus sévère dans l’Arena text, où il occupe l’une des dernières places, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. Dans l’Arena vision, GPT-5 nano reste également derrière ces trois modèles et l’écart avec Claude Fable 5 est important. Il reste pertinent pour les traitements à fort volume où le coût, le contexte étendu et les mathématiques priment sur la préférence humaine globale. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).