GPT-4.1 mini

GPT-4.1 mini est un LLM propriétaire d’OpenAI, sorti le 14 avril 2025. Près d’un an représente une ancienneté très longue à l’échelle de l’IA : le modèle doit surtout être comparé aux références de sa période, aujourd’hui probablement dépassées et souvent retirées des catalogues.

GPT-4.1 mini est un LLM propriétaire d’OpenAI, sorti le 14 avril 2025. Près d’un an représente une ancienneté très longue à l’échelle de l’IA : le modèle doit surtout être comparé aux références de sa période, aujourd’hui probablement dépassées et souvent retirées des catalogues.

Son principal trait distinctif reste sa fenêtre de contexte d’environ 1,0 million de tokens. Il adopte aussi un positionnement très économique, avec des tarifs nettement inférieurs à ceux des LLM similaires. Ses connaissances s’arrêtent au 31 mai 2024.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie14 avril 2025
Connaissances jusqu'à2024-05-31
Multimodaloui
Fenêtre de contexte1 047 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index14.8114ᵉ / 137
Code Index20.265ᵉ / 74
Agentic Index1.761ᵉ / 68
Math Index46.335ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,0 %75ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)95,0 %21ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)92,0 %56ᵉ / 162benchable✅ Mesuré
Epoch: MATH level 587,3 %11ᵉ / 59epoch✅ Mesuré
Benchable : Instruction Following (Baseline)76,4 %38ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)72,0 %89ᵉ / 155benchable✅ Mesuré
Benchable : Hallucinations (Baseline)70,0 %118ᵉ / 146benchable✅ Mesuré
Epoch: GPQA diamond65,8 %34ᵉ / 85epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-202544,7 %31ᵉ / 64epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public10,0 %14ᵉ / 33epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private4,5 %22ᵉ / 32epoch✅ Mesuré
CharXiv-D88,4 %6ᵉ / 16llm-statsAuto-déclaré
MMLU87,5 %21ᵉ / 98llm-statsAuto-déclaré
IFEval84,1 %41ᵉ / 65llm-statsAuto-déclaré
MMMLU78,5 %40ᵉ / 49llm-statsAuto-déclaré
MathVista73,1 %9ᵉ / 38llm-statsAuto-déclaré
MMMU72,7 %25ᵉ / 61llm-statsAuto-déclaré
Multi-IF67,0 %17ᵉ / 20llm-statsAuto-déclaré
GPQA65,0 %139ᵉ / 219llm-statsAuto-déclaré
Graphwalks BFS <128k61,7 %6ᵉ / 10llm-statsAuto-déclaré
Graphwalks parents <128k60,5 %5ᵉ / 10llm-statsAuto-déclaré
CharXiv-R56,8 %35ᵉ / 45llm-statsAuto-déclaré
TAU-bench Retail55,8 %21ᵉ / 24llm-statsAuto-déclaré
COLLIE54,6 %9ᵉ / 10llm-statsAuto-déclaré
AIME 202449,6 %46ᵉ / 52llm-statsAuto-déclaré
ComplexFuncBench49,3 %5ᵉ / 7llm-statsAuto-déclaré
OpenAI-MRCR: 2 needle 128k47,2 %4ᵉ / 8llm-statsAuto-déclaré
Internal API instruction following (hard)45,1 %5ᵉ / 7llm-statsAuto-déclaré
AIME 202540,2 %103ᵉ / 108llm-statsAuto-déclaré
TAU-bench Airline36,0 %19ᵉ / 22llm-statsAuto-déclaré
Multi-Challenge35,8 %25ᵉ / 28llm-statsAuto-déclaré
HMMT 202535,0 %31ᵉ / 33llm-statsAuto-déclaré
Aider-Polyglot34,7 %19ᵉ / 22llm-statsAuto-déclaré
OpenAI-MRCR: 2 needle 1M33,3 %3ᵉ / 4llm-statsAuto-déclaré
Aider-Polyglot Edit31,6 %8ᵉ / 10llm-statsAuto-déclaré
SWE-Bench Verified23,6 %99ᵉ / 102llm-statsAuto-déclaré
Graphwalks BFS >128k15,0 %10ᵉ / 11llm-statsAuto-déclaré
Graphwalks parents >128k11,0 %6ᵉ / 7llm-statsAuto-déclaré
Humanity's Last Exam3,7 %89ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nova 2.0 Pro Preview21.8
▶ GPT-4.1 mini14.8

Code Index

Nova 2.0 Pro Preview34.0
▶ GPT-4.1 mini20.2

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
149ᵉminimax-m2.1-preview1384
150ᵉQwen: Qwen3 30B A3B Instruct 25071383
151ᵉGPT-4.1 mini1383
152ᵉHunyuan-TurboS1382
153ᵉGemini 2.5 Flash Lite Preview1380

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
59ᵉGPT-5.4 nano1205
60ᵉMistral Large 31203
61ᵉGPT-4.1 mini1202
62ᵉo4-mini1201
63ᵉMistral Medium 3.51199

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI0,4 $1,6 $0,1 $
openai0,4 $1,6 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 81 % en dessous de la moyenne des LLM similaires, et 13,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,02 $
Latence moyenne par benchmark — Benchable2 min 54 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, GPT-4.1 mini figurait dans le top 13% des 53 LLM de sa génération sur GPQA diamond. Son résultat de 87% à MATH level 5 le plaçait également dans le haut du classement. Sa fenêtre de 1 047 576 tokens constitue un autre point marquant. Son tarif est 81% inférieur à la moyenne des LLM similaires et environ 13,8 fois inférieur à celui des modèles frontière.

Limites et points d’attention. Ses performances sont aujourd’hui largement dépassées. L’Intelligence Index, le Code Index et l’Agentic Index le placent en retrait, tandis que le Math Index reste en milieu de tableau. Dans les Arena text et vision, il se classe respectivement 151e sur 200 et 61e sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. Dans les deux cas, le premier est nettement devant. Pour un résultat plus abouti, Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7 constituent de meilleurs choix.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).