GPT-4o mini
GPT-4o mini est un LLM propriétaire lancé par OpenAI le 18 juillet 2024. Près de deux ans après sa sortie, il est déjà très ancien à l’échelle de l’IA et largement distancé par les modèles plus récents.
GPT-4o mini est un LLM propriétaire lancé par OpenAI le 18 juillet 2024. Près de deux ans après sa sortie, il est déjà très ancien à l’échelle de l’IA et largement distancé par les modèles plus récents.
Son positionnement repose sur un tarif très économique et une fenêtre de contexte de 128 000 tokens. Ses connaissances s’arrêtent au 1er octobre 2023. Sa tarification se situe 93% sous la moyenne des LLM similaires et environ 36.7 fois sous celle des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 18 juillet 2024 |
| Connaissances jusqu'à | 2023-10-01 |
| Multimodal | oui |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 6.9 | 135ᵉ / 137 |
| Code Index | 11.4 | 72ᵉ / 74 |
| Agentic Index | 1.0 | 66ᵉ / 68 |
| Math Index | 14.7 | 48ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 87,0 % | 87ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 76,0 % | 113ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 71,0 % | 111ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 60,5 % | 87ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 56,0 % | 109ᵉ / 155 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 52,6 % | 26ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 37,7 % | 63ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 6,9 % | 43ᵉ / 64 | epoch | ✅ Mesuré |
| HumanEval | 87,2 % | 28ᵉ / 65 | llm-stats | Auto-déclaré |
| MGSM | 87,0 % | 12ᵉ / 30 | llm-stats | Auto-déclaré |
| MMLU | 82,0 % | 48ᵉ / 98 | llm-stats | Auto-déclaré |
| DROP | 79,7 % | 12ᵉ / 29 | llm-stats | Auto-déclaré |
| MATH | 70,2 % | 37ᵉ / 70 | llm-stats | Auto-déclaré |
| MMMU | 59,4 % | 43ᵉ / 61 | llm-stats | Auto-déclaré |
| MathVista | 56,7 % | 29ᵉ / 38 | llm-stats | Auto-déclaré |
| GPQA | 40,2 % | 191ᵉ / 219 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 8,7 % | 102ᵉ / 102 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 103ᵉ | GPT-4 Turbo | 1112 |
| 104ᵉ | AllenAI: Molmo2 8B | 1107 |
| 105ᵉ | GPT-4o mini | 1098 |
| 106ᵉ | Pixtral Large | 1095 |
| 107ᵉ | GPT-4.1 nano | 1089 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Azure | 0,15 $ | 0,6 $ | 0,075 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 93 % en dessous de la moyenne des LLM similaires, et 36,7 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 2 min 09 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, GPT-4o mini figurait dans le top 34% des 29 LLM de sa génération sur GPQA diamond. Il atteint aussi le plafond des benchmarks Ethics et General Knowledge, mais partage ces résultats avec de nombreux modèles, ce qui limite leur portée comparative. Sa fenêtre de contexte étendue et son prix très bas constituaient ses principaux atouts pratiques.
Limites et points d’attention. Les Intelligence Index, Code Index et Agentic Index le placent presque en fin de classement. Le Math Index reste également en retrait. Les résultats en hallucinations et en mathématiques se situent dans le bas des classements Benchable. Dans l’Arena vision, GPT-4o mini occupe la 105e place sur 135, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. L’écart avec le premier est important. Après près de deux ans, ses performances sont largement dépassées et le modèle est souvent absent du catalogue actuel de l’éditeur. Son principal intérêt résiduel tient à son faible coût. Pour un résultat plus abouti en vision, on lui préférera Claude Fable 5, Claude Opus 4.7 ou Claude Opus 4.6.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).