GPT-4.1 nano

GPT-4.1 nano est un LLM propriétaire d’OpenAI, sorti le 14 avril 2025. À environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA. Ses performances se comprennent donc par rapport à son époque : à sa sortie, il figurait dans le top 32% des LLM de sa génération sur…

GPT-4.1 nano est un LLM propriétaire d’OpenAI, sorti le 14 avril 2025. À environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA. Ses performances se comprennent donc par rapport à son époque : à sa sortie, il figurait dans le top 32% des LLM de sa génération sur Epoch: GPQA diamond.

Le modèle se distingue surtout par une fenêtre de contexte de 1 047 576 tokens et un positionnement très économique. Ses tarifs sont 95% inférieurs à la moyenne des LLM similaires et environ 55 fois inférieurs à ceux des modèles frontière. Ses connaissances s’arrêtent au 31 mai 2024.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie14 avril 2025
Connaissances jusqu'à2024-05-31
Multimodaloui
Fenêtre de contexte1 047 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index9.6128ᵉ / 137
Code Index11.173ᵉ / 74
Agentic Index1.265ᵉ / 68
Math Index24.042ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)96,5 %106ᵉ / 161benchable✅ Mesuré
Benchable : Hallucinations (Baseline)96,0 %67ᵉ / 146benchable✅ Mesuré
Benchable : Mathematics (Baseline)92,5 %60ᵉ / 140benchable✅ Mesuré
Benchable : Email Classification (Baseline)92,0 %140ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)84,0 %96ᵉ / 162benchable✅ Mesuré
Epoch: MATH level 570,0 %18ᵉ / 59epoch✅ Mesuré
Benchable : Reasoning (Baseline)56,0 %109ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)55,5 %99ᵉ / 163benchable✅ Mesuré
Epoch: GPQA diamond48,9 %44ᵉ / 85epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-202528,9 %36ᵉ / 64epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private1,0 %28ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public0,0 %17ᵉ / 33epoch✅ Mesuré
MMLU80,1 %60ᵉ / 98llm-statsAuto-déclaré
IFEval74,5 %60ᵉ / 65llm-statsAuto-déclaré
CharXiv-D73,9 %16ᵉ / 16llm-statsAuto-déclaré
MMMLU66,9 %46ᵉ / 49llm-statsAuto-déclaré
Multi-IF57,2 %20ᵉ / 20llm-statsAuto-déclaré
MathVista56,2 %30ᵉ / 38llm-statsAuto-déclaré
MMMU55,4 %49ᵉ / 61llm-statsAuto-déclaré
GPQA50,3 %163ᵉ / 219llm-statsAuto-déclaré
COLLIE42,5 %10ᵉ / 10llm-statsAuto-déclaré
CharXiv-R40,5 %44ᵉ / 45llm-statsAuto-déclaré
OpenAI-MRCR: 2 needle 128k36,6 %6ᵉ / 8llm-statsAuto-déclaré
Internal API instruction following (hard)31,6 %6ᵉ / 7llm-statsAuto-déclaré
AIME 202429,4 %51ᵉ / 52llm-statsAuto-déclaré
Graphwalks BFS <128k25,0 %10ᵉ / 10llm-statsAuto-déclaré
TAU-bench Retail22,6 %24ᵉ / 24llm-statsAuto-déclaré
Multi-Challenge15,0 %28ᵉ / 28llm-statsAuto-déclaré
TAU-bench Airline14,0 %22ᵉ / 22llm-statsAuto-déclaré
OpenAI-MRCR: 2 needle 1M12,0 %4ᵉ / 4llm-statsAuto-déclaré
Aider-Polyglot9,8 %22ᵉ / 22llm-statsAuto-déclaré
Graphwalks parents <128k9,4 %10ᵉ / 10llm-statsAuto-déclaré
Aider-Polyglot Edit6,2 %10ᵉ / 10llm-statsAuto-déclaré
ComplexFuncBench5,7 %7ᵉ / 7llm-statsAuto-déclaré
Graphwalks parents >128k5,6 %7ᵉ / 7llm-statsAuto-déclaré
Graphwalks BFS >128k2,9 %11ᵉ / 11llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ GPT-4.1 nano9.6

Code Index

▶ GPT-4.1 nano11.1

Classements Arena (Elo)

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
105ᵉGPT-4o mini1098
106ᵉPixtral Large1095
107ᵉGPT-4.1 nano1089
108ᵉqwen-vl-max-11191085
109ᵉqwen2-vl-72b1085

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI0,1 $0,4 $0,025 $
openai0,1 $0,4 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 55 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0 $
Latence moyenne par benchmark — Benchable2 min 05 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. GPT-4.1 nano associe une fenêtre de contexte d’environ un million de tokens à un coût très faible, avec une entrée facturée 0.1 $ par million de tokens et une sortie à 0.4 $. À sa sortie, son classement sur GPQA diamond le plaçait dans le haut de sa génération. Sur Benchable Mathematics, il obtient 92% et se situe dans la première moitié du classement. Ses scores Baseline atteignent aussi 96% en connaissances générales et sur les hallucinations, mais ces benchmarks plafonnés départagent peu les modèles.

Limites et points d’attention. Les indices globaux placent GPT-4.1 nano en net retrait, près du bas du classement en Intelligence Index, Code Index et Agentic Index. Son Math Index reste également sous la moyenne du panel évalué. Dans l’Arena vision, il occupe le 107e rang sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. Le premier est nettement devant. À environ un an, ses performances sont aujourd’hui largement dépassées et cette génération de modèles est souvent retirée des catalogues. Son faible coût et son vaste contexte conservent un intérêt pour des traitements économiques de gros volumes. Pour un résultat visuel plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.7 ou Claude Opus 4.6.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).