GPT-4.1

GPT-4.1 est un LLM propriétaire d’OpenAI, sorti le 14 avril 2025. Près d’un an représente une ancienneté très élevée dans l’IA : le modèle appartient déjà à une génération probablement dépassée, dont les références sont souvent retirées des catalogues.

GPT-4.1 est un LLM propriétaire d’OpenAI, sorti le 14 avril 2025. Près d’un an représente une ancienneté très élevée dans l’IA : le modèle appartient déjà à une génération probablement dépassée, dont les références sont souvent retirées des catalogues.

Sa principale caractéristique reste sa fenêtre de contexte d’environ 1,0 million de tokens, associée à des connaissances arrêtées au 1er juin 2024. Son positionnement économique renforce son intérêt : sa tarification se situe 4% sous la moyenne des LLM similaires et environ 2,8 fois sous celle des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie14 avril 2025
Connaissances jusqu'à2024-06-01
Multimodaloui
Fenêtre de contexte1 047 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index19.4106ᵉ / 137
Math Index34.741ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)96,0 %8ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)91,0 %66ᵉ / 162benchable✅ Mesuré
Benchable : Hallucinations (Baseline)88,0 %97ᵉ / 146benchable✅ Mesuré
Epoch: MATH level 583,0 %15ᵉ / 59epoch✅ Mesuré
Benchable : Reasoning (Baseline)82,0 %67ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)76,0 %39ᵉ / 163benchable✅ Mesuré
Epoch: GPQA diamond66,9 %33ᵉ / 85epoch✅ Mesuré
Epoch: SWE-Bench verified48,5 %14ᵉ / 15epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-202538,3 %32ᵉ / 64epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private5,5 %21ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private0,0 %20ᵉ / 25epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Public0,0 %1ᵉ / 15epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public0,0 %17ᵉ / 33epoch✅ Mesuré
MMLU90,2 %8ᵉ / 98llm-statsAuto-déclaré
CharXiv-D87,9 %8ᵉ / 16llm-statsAuto-déclaré
IFEval87,4 %33ᵉ / 65llm-statsAuto-déclaré
MMMLU87,3 %20ᵉ / 49llm-statsAuto-déclaré
MMMU74,8 %21ᵉ / 61llm-statsAuto-déclaré
MathVista72,2 %11ᵉ / 38llm-statsAuto-déclaré
Multi-IF70,8 %15ᵉ / 20llm-statsAuto-déclaré
TAU-bench Retail68,0 %14ᵉ / 24llm-statsAuto-déclaré
GPQA66,3 %132ᵉ / 219llm-statsAuto-déclaré
COLLIE65,8 %6ᵉ / 10llm-statsAuto-déclaré
ComplexFuncBench65,5 %2ᵉ / 7llm-statsAuto-déclaré
Graphwalks BFS <128k61,7 %6ᵉ / 10llm-statsAuto-déclaré
Graphwalks parents <128k58,0 %7ᵉ / 10llm-statsAuto-déclaré
OpenAI-MRCR: 2 needle 128k57,2 %3ᵉ / 8llm-statsAuto-déclaré
CharXiv-R56,7 %36ᵉ / 45llm-statsAuto-déclaré
SWE-Bench Verified54,6 %82ᵉ / 102llm-statsAuto-déclaré
Aider-Polyglot Edit52,9 %6ᵉ / 10llm-statsAuto-déclaré
Aider-Polyglot51,6 %15ᵉ / 22llm-statsAuto-déclaré
TAU-bench Airline49,4 %12ᵉ / 22llm-statsAuto-déclaré
Internal API instruction following (hard)49,1 %4ᵉ / 7llm-statsAuto-déclaré
AIME 202448,1 %47ᵉ / 52llm-statsAuto-déclaré
AIME 202546,4 %100ᵉ / 108llm-statsAuto-déclaré
OpenAI-MRCR: 2 needle 1M46,3 %2ᵉ / 4llm-statsAuto-déclaré
Multi-Challenge38,3 %24ᵉ / 28llm-statsAuto-déclaré
HMMT 202528,9 %33ᵉ / 33llm-statsAuto-déclaré
Graphwalks parents >128k25,0 %5ᵉ / 7llm-statsAuto-déclaré
Graphwalks BFS >128k19,0 %9ᵉ / 11llm-statsAuto-déclaré
Humanity's Last Exam5,4 %83ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nova 2.0 Pro Preview21.8
▶ GPT-4.119.4

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ GPT-4.134.7

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
109ᵉDeepSeek V3.1 Terminus1415
110ᵉamazon-nova-experimental-chat-26-01-101415
111ᵉGPT-4.11414
112ᵉClaude Opus 41412
113ᵉTencent: Hy3 preview1412

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
53ᵉQwen3 VL 235B A22B Instruct1215
54ᵉGemini 2.5 Flash1214
55ᵉGPT-4.11214
56ᵉGPT-51211
57ᵉClaude Sonnet 41207

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Azure2 $8 $0,5 $
openai2 $8 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 4 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,08 $
Latence moyenne par benchmark — Benchable2 min 33 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, GPT-4.1 figurait dans le top 11% des LLM de sa génération sur GPQA diamond. Son meilleur résultat Benchable concerne Mathematics : il partage la 8e place avec six autres modèles, même si ce benchmark plafonné distingue mal les meilleurs scores. Sa fenêtre de contexte de 1 047 576 tokens constitue son autre atout concret. Elle s’accompagne d’un tarif économique, notamment pour la sortie.

Limites et points d’attention. Les indices généraux le placent désormais en retrait, avec un Intelligence Index au bas du classement et un Math Index dans sa seconde moitié. Il occupe le 111e rang sur 200 dans l’Arena text et le 55e sur 135 dans l’Arena vision. Dans les deux arènes, il se place derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant dans les deux cas. Les scores Benchable élevés sont peu discriminants, car plusieurs épreuves sont plafonnées et largement partagées. GPT-4.1 garde surtout un intérêt pour un très long contexte à coût économique. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).