GPT-4.1
GPT-4.1 est un LLM propriétaire d’OpenAI, sorti le 14 avril 2025. Près d’un an représente une ancienneté très élevée dans l’IA : le modèle appartient déjà à une génération probablement dépassée, dont les références sont souvent retirées des catalogues.
GPT-4.1 est un LLM propriétaire d’OpenAI, sorti le 14 avril 2025. Près d’un an représente une ancienneté très élevée dans l’IA : le modèle appartient déjà à une génération probablement dépassée, dont les références sont souvent retirées des catalogues.
Sa principale caractéristique reste sa fenêtre de contexte d’environ 1,0 million de tokens, associée à des connaissances arrêtées au 1er juin 2024. Son positionnement économique renforce son intérêt : sa tarification se situe 4% sous la moyenne des LLM similaires et environ 2,8 fois sous celle des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 14 avril 2025 |
| Connaissances jusqu'à | 2024-06-01 |
| Multimodal | oui |
| Fenêtre de contexte | 1 047 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 19.4 | 106ᵉ / 137 |
| Math Index | 34.7 | 41ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 96,0 % | 8ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 91,0 % | 66ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 88,0 % | 97ᵉ / 146 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 83,0 % | 15ᵉ / 59 | epoch | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 82,0 % | 67ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 76,0 % | 39ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 66,9 % | 33ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: SWE-Bench verified | 48,5 % | 14ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 38,3 % | 32ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 5,5 % | 21ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 0,0 % | 20ᵉ / 25 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Public | 0,0 % | 1ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 0,0 % | 17ᵉ / 33 | epoch | ✅ Mesuré |
| MMLU | 90,2 % | 8ᵉ / 98 | llm-stats | Auto-déclaré |
| CharXiv-D | 87,9 % | 8ᵉ / 16 | llm-stats | Auto-déclaré |
| IFEval | 87,4 % | 33ᵉ / 65 | llm-stats | Auto-déclaré |
| MMMLU | 87,3 % | 20ᵉ / 49 | llm-stats | Auto-déclaré |
| MMMU | 74,8 % | 21ᵉ / 61 | llm-stats | Auto-déclaré |
| MathVista | 72,2 % | 11ᵉ / 38 | llm-stats | Auto-déclaré |
| Multi-IF | 70,8 % | 15ᵉ / 20 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 68,0 % | 14ᵉ / 24 | llm-stats | Auto-déclaré |
| GPQA | 66,3 % | 132ᵉ / 219 | llm-stats | Auto-déclaré |
| COLLIE | 65,8 % | 6ᵉ / 10 | llm-stats | Auto-déclaré |
| ComplexFuncBench | 65,5 % | 2ᵉ / 7 | llm-stats | Auto-déclaré |
| Graphwalks BFS <128k | 61,7 % | 6ᵉ / 10 | llm-stats | Auto-déclaré |
| Graphwalks parents <128k | 58,0 % | 7ᵉ / 10 | llm-stats | Auto-déclaré |
| OpenAI-MRCR: 2 needle 128k | 57,2 % | 3ᵉ / 8 | llm-stats | Auto-déclaré |
| CharXiv-R | 56,7 % | 36ᵉ / 45 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 54,6 % | 82ᵉ / 102 | llm-stats | Auto-déclaré |
| Aider-Polyglot Edit | 52,9 % | 6ᵉ / 10 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 51,6 % | 15ᵉ / 22 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 49,4 % | 12ᵉ / 22 | llm-stats | Auto-déclaré |
| Internal API instruction following (hard) | 49,1 % | 4ᵉ / 7 | llm-stats | Auto-déclaré |
| AIME 2024 | 48,1 % | 47ᵉ / 52 | llm-stats | Auto-déclaré |
| AIME 2025 | 46,4 % | 100ᵉ / 108 | llm-stats | Auto-déclaré |
| OpenAI-MRCR: 2 needle 1M | 46,3 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| Multi-Challenge | 38,3 % | 24ᵉ / 28 | llm-stats | Auto-déclaré |
| HMMT 2025 | 28,9 % | 33ᵉ / 33 | llm-stats | Auto-déclaré |
| Graphwalks parents >128k | 25,0 % | 5ᵉ / 7 | llm-stats | Auto-déclaré |
| Graphwalks BFS >128k | 19,0 % | 9ᵉ / 11 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 5,4 % | 83ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 109ᵉ | DeepSeek V3.1 Terminus | 1415 |
| 110ᵉ | amazon-nova-experimental-chat-26-01-10 | 1415 |
| 111ᵉ | GPT-4.1 | 1414 |
| 112ᵉ | Claude Opus 4 | 1412 |
| 113ᵉ | Tencent: Hy3 preview | 1412 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 53ᵉ | Qwen3 VL 235B A22B Instruct | 1215 |
| 54ᵉ | Gemini 2.5 Flash | 1214 |
| 55ᵉ | GPT-4.1 | 1214 |
| 56ᵉ | GPT-5 | 1211 |
| 57ᵉ | Claude Sonnet 4 | 1207 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Azure | 2 $ | 8 $ | 0,5 $ |
| openai | 2 $ | 8 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 4 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,08 $ |
| Latence moyenne par benchmark — Benchable | 2 min 33 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, GPT-4.1 figurait dans le top 11% des LLM de sa génération sur GPQA diamond. Son meilleur résultat Benchable concerne Mathematics : il partage la 8e place avec six autres modèles, même si ce benchmark plafonné distingue mal les meilleurs scores. Sa fenêtre de contexte de 1 047 576 tokens constitue son autre atout concret. Elle s’accompagne d’un tarif économique, notamment pour la sortie.
Limites et points d’attention. Les indices généraux le placent désormais en retrait, avec un Intelligence Index au bas du classement et un Math Index dans sa seconde moitié. Il occupe le 111e rang sur 200 dans l’Arena text et le 55e sur 135 dans l’Arena vision. Dans les deux arènes, il se place derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant dans les deux cas. Les scores Benchable élevés sont peu discriminants, car plusieurs épreuves sont plafonnées et largement partagées. GPT-4.1 garde surtout un intérêt pour un très long contexte à coût économique. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).