GPT-5.4 nano
GPT-5.4 nano est un LLM propriétaire d’OpenAI, lancé le 17 mars 2026. Son positionnement très économique constitue son principal trait distinctif, avec une tarification inférieure de 90% à la moyenne des LLM similaires.
GPT-5.4 nano est un LLM propriétaire d’OpenAI, lancé le 17 mars 2026. Son positionnement très économique constitue son principal trait distinctif, avec une tarification inférieure de 90% à la moyenne des LLM similaires.
Le modèle accepte jusqu’à 400 000 tokens de contexte et s’appuie sur des connaissances arrêtées au 31 août 2025. À sa sortie, il se situait dans le top 45% des LLM de sa génération sur GPQA diamond, un résultat intermédiaire qui reflète un compromis entre capacités, contexte étendu et coût réduit.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 17 mars 2026 |
| Connaissances jusqu'à | 2025-08-31 |
| Multimodal | oui |
| Fenêtre de contexte | 400 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 30.2 | 61ᵉ / 137 |
| Code Index | 56.1 | 25ᵉ / 74 |
| Agentic Index | 27.5 | 26ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Tau2 Telecom | 92,5 % | 14ᵉ / 34 | llm-stats | Auto-déclaré |
| GPQA | 82,8 % | 61ᵉ / 219 | llm-stats | Auto-déclaré |
| OmniDocBench 1.5 | 75,8 % | 12ᵉ / 13 | llm-stats | Auto-déclaré |
| Graphwalks BFS <128k | 73,4 % | 4ᵉ / 10 | llm-stats | Auto-déclaré |
| LiveBench | 70,1 % | 30ᵉ / 38 | llm-stats | n.d. |
| MMMU-Pro | 66,1 % | 39ᵉ / 64 | llm-stats | Auto-déclaré |
| MCP Atlas | 56,1 % | 29ᵉ / 30 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 52,4 % | 36ᵉ / 41 | llm-stats | Auto-déclaré |
| Graphwalks parents <128k | 50,8 % | 8ᵉ / 10 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 46,3 % | 41ᵉ / 49 | llm-stats | Auto-déclaré |
| OSWorld-Verified | 39,0 % | 19ᵉ / 19 | llm-stats | Auto-déclaré |
| Finance Agent v2 | 38,2 % | 17ᵉ / 26 | llm-stats | n.d. |
| GDPval-AA | 37,2 % | 30ᵉ / 39 | llm-stats | n.d. |
| Toolathlon | 35,5 % | 26ᵉ / 30 | llm-stats | Auto-déclaré |
| MRCR v2 (8-needle) | 33,1 % | 11ᵉ / 19 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 24,3 % | 49ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 121ᵉ | Gemini 2.5 Flash Preview | 1404 |
| 122ᵉ | Grok 4 Fast | 1404 |
| 123ᵉ | GPT-5.4 nano | 1404 |
| 124ᵉ | Qwen3 235B A22B | 1403 |
| 125ᵉ | o1 | 1402 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 57ᵉ | Claude Sonnet 4 | 1207 |
| 58ᵉ | Claude Opus 4 | 1206 |
| 59ᵉ | GPT-5.4 nano | 1205 |
| 60ᵉ | Mistral Large 3 | 1203 |
| 61ᵉ | GPT-4.1 mini | 1202 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Azure | 0,2 $ | 1,25 $ | 0,02 $ |
| openai | 0,2 $ | 1,25 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 90 % en dessous de la moyenne des LLM similaires, et 27,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 1,41 $ |
| Durée d'exécution — PinchBench | 3 h 57 min |
| Indice valeur/coût — PinchBench | 99,37 |
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 1 min 24 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. GPT-5.4 nano se distingue surtout en mathématiques. Il atteint le top 10 de LiveBench Mathematics et obtient également un résultat élevé sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée. Son Code Index le place dans le premier tiers du classement associé, tandis que son Agentic Index se situe dans la moitié supérieure. Sa fenêtre de 400 000 tokens constitue un autre atout concret. Le tarif renforce ce positionnement : le modèle coûte environ 27,5 fois moins cher que les modèles frontière.
Limites et points d’attention. L’Intelligence Index place GPT-5.4 nano dans le milieu du classement plutôt que parmi les modèles les plus performants. Ses scores Benchable sont élevés en valeur absolue sur l’éthique, les hallucinations, la classification d’e-mails et les connaissances générales, mais leurs rangs relatifs restent moyens ou faibles face aux modèles évalués. Les classements Arena confirment cette réserve : le modèle se situe sous le milieu du tableau en texte comme en vision, avec un écart sensible par rapport au leader. GPT-5.4 nano correspond surtout aux usages sensibles au coût, avec un intérêt particulier pour les mathématiques, le code et les longs contextes.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).