GPT-4.1 mini
GPT-4.1 mini est un LLM propriétaire d’OpenAI, sorti le 14 avril 2025. Près d’un an représente une ancienneté très longue à l’échelle de l’IA : le modèle doit surtout être comparé aux références de sa période, aujourd’hui probablement dépassées et souvent retirées des catalogues.
GPT-4.1 mini est un LLM propriétaire d’OpenAI, sorti le 14 avril 2025. Près d’un an représente une ancienneté très longue à l’échelle de l’IA : le modèle doit surtout être comparé aux références de sa période, aujourd’hui probablement dépassées et souvent retirées des catalogues.
Son principal trait distinctif reste sa fenêtre de contexte d’environ 1,0 million de tokens. Il adopte aussi un positionnement très économique, avec des tarifs nettement inférieurs à ceux des LLM similaires. Ses connaissances s’arrêtent au 31 mai 2024.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 14 avril 2025 |
| Connaissances jusqu'à | 2024-05-31 |
| Multimodal | oui |
| Fenêtre de contexte | 1 047 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 14.8 | 114ᵉ / 137 |
| Code Index | 20.2 | 65ᵉ / 74 |
| Agentic Index | 1.7 | 61ᵉ / 68 |
| Math Index | 46.3 | 35ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,0 % | 75ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 95,0 % | 21ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 92,0 % | 56ᵉ / 162 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 87,3 % | 11ᵉ / 59 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 76,4 % | 38ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 72,0 % | 89ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 70,0 % | 118ᵉ / 146 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 65,8 % | 34ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 44,7 % | 31ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 10,0 % | 14ᵉ / 33 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 4,5 % | 22ᵉ / 32 | epoch | ✅ Mesuré |
| CharXiv-D | 88,4 % | 6ᵉ / 16 | llm-stats | Auto-déclaré |
| MMLU | 87,5 % | 21ᵉ / 98 | llm-stats | Auto-déclaré |
| IFEval | 84,1 % | 41ᵉ / 65 | llm-stats | Auto-déclaré |
| MMMLU | 78,5 % | 40ᵉ / 49 | llm-stats | Auto-déclaré |
| MathVista | 73,1 % | 9ᵉ / 38 | llm-stats | Auto-déclaré |
| MMMU | 72,7 % | 25ᵉ / 61 | llm-stats | Auto-déclaré |
| Multi-IF | 67,0 % | 17ᵉ / 20 | llm-stats | Auto-déclaré |
| GPQA | 65,0 % | 139ᵉ / 219 | llm-stats | Auto-déclaré |
| Graphwalks BFS <128k | 61,7 % | 6ᵉ / 10 | llm-stats | Auto-déclaré |
| Graphwalks parents <128k | 60,5 % | 5ᵉ / 10 | llm-stats | Auto-déclaré |
| CharXiv-R | 56,8 % | 35ᵉ / 45 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 55,8 % | 21ᵉ / 24 | llm-stats | Auto-déclaré |
| COLLIE | 54,6 % | 9ᵉ / 10 | llm-stats | Auto-déclaré |
| AIME 2024 | 49,6 % | 46ᵉ / 52 | llm-stats | Auto-déclaré |
| ComplexFuncBench | 49,3 % | 5ᵉ / 7 | llm-stats | Auto-déclaré |
| OpenAI-MRCR: 2 needle 128k | 47,2 % | 4ᵉ / 8 | llm-stats | Auto-déclaré |
| Internal API instruction following (hard) | 45,1 % | 5ᵉ / 7 | llm-stats | Auto-déclaré |
| AIME 2025 | 40,2 % | 103ᵉ / 108 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 36,0 % | 19ᵉ / 22 | llm-stats | Auto-déclaré |
| Multi-Challenge | 35,8 % | 25ᵉ / 28 | llm-stats | Auto-déclaré |
| HMMT 2025 | 35,0 % | 31ᵉ / 33 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 34,7 % | 19ᵉ / 22 | llm-stats | Auto-déclaré |
| OpenAI-MRCR: 2 needle 1M | 33,3 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| Aider-Polyglot Edit | 31,6 % | 8ᵉ / 10 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 23,6 % | 99ᵉ / 102 | llm-stats | Auto-déclaré |
| Graphwalks BFS >128k | 15,0 % | 10ᵉ / 11 | llm-stats | Auto-déclaré |
| Graphwalks parents >128k | 11,0 % | 6ᵉ / 7 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 3,7 % | 89ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 149ᵉ | minimax-m2.1-preview | 1384 |
| 150ᵉ | Qwen: Qwen3 30B A3B Instruct 2507 | 1383 |
| 151ᵉ | GPT-4.1 mini | 1383 |
| 152ᵉ | Hunyuan-TurboS | 1382 |
| 153ᵉ | Gemini 2.5 Flash Lite Preview | 1380 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 59ᵉ | GPT-5.4 nano | 1205 |
| 60ᵉ | Mistral Large 3 | 1203 |
| 61ᵉ | GPT-4.1 mini | 1202 |
| 62ᵉ | o4-mini | 1201 |
| 63ᵉ | Mistral Medium 3.5 | 1199 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 0,4 $ | 1,6 $ | 0,1 $ |
| openai | 0,4 $ | 1,6 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 81 % en dessous de la moyenne des LLM similaires, et 13,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,02 $ |
| Latence moyenne par benchmark — Benchable | 2 min 54 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, GPT-4.1 mini figurait dans le top 13% des 53 LLM de sa génération sur GPQA diamond. Son résultat de 87% à MATH level 5 le plaçait également dans le haut du classement. Sa fenêtre de 1 047 576 tokens constitue un autre point marquant. Son tarif est 81% inférieur à la moyenne des LLM similaires et environ 13,8 fois inférieur à celui des modèles frontière.
Limites et points d’attention. Ses performances sont aujourd’hui largement dépassées. L’Intelligence Index, le Code Index et l’Agentic Index le placent en retrait, tandis que le Math Index reste en milieu de tableau. Dans les Arena text et vision, il se classe respectivement 151e sur 200 et 61e sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. Dans les deux cas, le premier est nettement devant. Pour un résultat plus abouti, Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7 constituent de meilleurs choix.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).