GPT-4.1 nano
GPT-4.1 nano est un LLM propriétaire d’OpenAI, sorti le 14 avril 2025. À environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA. Ses performances se comprennent donc par rapport à son époque : à sa sortie, il figurait dans le top 32% des LLM de sa génération sur…
GPT-4.1 nano est un LLM propriétaire d’OpenAI, sorti le 14 avril 2025. À environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA. Ses performances se comprennent donc par rapport à son époque : à sa sortie, il figurait dans le top 32% des LLM de sa génération sur Epoch: GPQA diamond.
Le modèle se distingue surtout par une fenêtre de contexte de 1 047 576 tokens et un positionnement très économique. Ses tarifs sont 95% inférieurs à la moyenne des LLM similaires et environ 55 fois inférieurs à ceux des modèles frontière. Ses connaissances s’arrêtent au 31 mai 2024.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 14 avril 2025 |
| Connaissances jusqu'à | 2024-05-31 |
| Multimodal | oui |
| Fenêtre de contexte | 1 047 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 9.6 | 128ᵉ / 137 |
| Code Index | 11.1 | 73ᵉ / 74 |
| Agentic Index | 1.2 | 65ᵉ / 68 |
| Math Index | 24.0 | 42ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 96,5 % | 106ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 96,0 % | 67ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 92,5 % | 60ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 92,0 % | 140ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 84,0 % | 96ᵉ / 162 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 70,0 % | 18ᵉ / 59 | epoch | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 56,0 % | 109ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 55,5 % | 99ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 48,9 % | 44ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 28,9 % | 36ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 1,0 % | 28ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 0,0 % | 17ᵉ / 33 | epoch | ✅ Mesuré |
| MMLU | 80,1 % | 60ᵉ / 98 | llm-stats | Auto-déclaré |
| IFEval | 74,5 % | 60ᵉ / 65 | llm-stats | Auto-déclaré |
| CharXiv-D | 73,9 % | 16ᵉ / 16 | llm-stats | Auto-déclaré |
| MMMLU | 66,9 % | 46ᵉ / 49 | llm-stats | Auto-déclaré |
| Multi-IF | 57,2 % | 20ᵉ / 20 | llm-stats | Auto-déclaré |
| MathVista | 56,2 % | 30ᵉ / 38 | llm-stats | Auto-déclaré |
| MMMU | 55,4 % | 49ᵉ / 61 | llm-stats | Auto-déclaré |
| GPQA | 50,3 % | 163ᵉ / 219 | llm-stats | Auto-déclaré |
| COLLIE | 42,5 % | 10ᵉ / 10 | llm-stats | Auto-déclaré |
| CharXiv-R | 40,5 % | 44ᵉ / 45 | llm-stats | Auto-déclaré |
| OpenAI-MRCR: 2 needle 128k | 36,6 % | 6ᵉ / 8 | llm-stats | Auto-déclaré |
| Internal API instruction following (hard) | 31,6 % | 6ᵉ / 7 | llm-stats | Auto-déclaré |
| AIME 2024 | 29,4 % | 51ᵉ / 52 | llm-stats | Auto-déclaré |
| Graphwalks BFS <128k | 25,0 % | 10ᵉ / 10 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 22,6 % | 24ᵉ / 24 | llm-stats | Auto-déclaré |
| Multi-Challenge | 15,0 % | 28ᵉ / 28 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 14,0 % | 22ᵉ / 22 | llm-stats | Auto-déclaré |
| OpenAI-MRCR: 2 needle 1M | 12,0 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 9,8 % | 22ᵉ / 22 | llm-stats | Auto-déclaré |
| Graphwalks parents <128k | 9,4 % | 10ᵉ / 10 | llm-stats | Auto-déclaré |
| Aider-Polyglot Edit | 6,2 % | 10ᵉ / 10 | llm-stats | Auto-déclaré |
| ComplexFuncBench | 5,7 % | 7ᵉ / 7 | llm-stats | Auto-déclaré |
| Graphwalks parents >128k | 5,6 % | 7ᵉ / 7 | llm-stats | Auto-déclaré |
| Graphwalks BFS >128k | 2,9 % | 11ᵉ / 11 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 105ᵉ | GPT-4o mini | 1098 |
| 106ᵉ | Pixtral Large | 1095 |
| 107ᵉ | GPT-4.1 nano | 1089 |
| 108ᵉ | qwen-vl-max-1119 | 1085 |
| 109ᵉ | qwen2-vl-72b | 1085 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 0,1 $ | 0,4 $ | 0,025 $ |
| openai | 0,1 $ | 0,4 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 55 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 2 min 05 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. GPT-4.1 nano associe une fenêtre de contexte d’environ un million de tokens à un coût très faible, avec une entrée facturée 0.1 $ par million de tokens et une sortie à 0.4 $. À sa sortie, son classement sur GPQA diamond le plaçait dans le haut de sa génération. Sur Benchable Mathematics, il obtient 92% et se situe dans la première moitié du classement. Ses scores Baseline atteignent aussi 96% en connaissances générales et sur les hallucinations, mais ces benchmarks plafonnés départagent peu les modèles.
Limites et points d’attention. Les indices globaux placent GPT-4.1 nano en net retrait, près du bas du classement en Intelligence Index, Code Index et Agentic Index. Son Math Index reste également sous la moyenne du panel évalué. Dans l’Arena vision, il occupe le 107e rang sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. Le premier est nettement devant. À environ un an, ses performances sont aujourd’hui largement dépassées et cette génération de modèles est souvent retirée des catalogues. Son faible coût et son vaste contexte conservent un intérêt pour des traitements économiques de gros volumes. Pour un résultat visuel plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.7 ou Claude Opus 4.6.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).