o4-mini
Publié par OpenAI le 16 avril 2025, o4-mini est un LLM propriétaire dont les poids ne sont pas ouverts. Près d’un an après sa sortie, il est déjà très ancien à l’échelle de l’IA et probablement dépassé par les modèles plus récents.
Publié par OpenAI le 16 avril 2025, o4-mini est un LLM propriétaire dont les poids ne sont pas ouverts. Près d’un an après sa sortie, il est déjà très ancien à l’échelle de l’IA et probablement dépassé par les modèles plus récents.
À son époque, o4-mini se distinguait par un raisonnement mathématique de haut niveau, une fenêtre de contexte de 200 000 tokens et un positionnement très économique. Ses connaissances s’arrêtent au 31 mai 2024. Son tarif se situe 45% sous la moyenne des LLM similaires et environ cinq fois sous celui des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 16 avril 2025 |
| Connaissances jusqu'à | 2024-05-31 |
| Multimodal | oui |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 25.6 | 77ᵉ / 137 |
| Math Index | 90.7 | 9ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2024 | 93,4 % | 2ᵉ / 52 | llm-stats | Auto-déclaré |
| AIME 2025 | 92,7 % | 30ᵉ / 108 | llm-stats | Auto-déclaré |
| MathVista | 84,3 % | 4ᵉ / 38 | llm-stats | Auto-déclaré |
| MMMU | 81,6 % | 11ᵉ / 61 | llm-stats | Auto-déclaré |
| GPQA | 81,4 % | 70ᵉ / 219 | llm-stats | Auto-déclaré |
| CharXiv-R | 72,0 % | 29ᵉ / 45 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 71,8 % | 9ᵉ / 24 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 68,9 % | 7ᵉ / 22 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 68,1 % | 64ᵉ / 102 | llm-stats | Auto-déclaré |
| Aider-Polyglot Edit | 58,2 % | 4ᵉ / 10 | llm-stats | Auto-déclaré |
| BrowseComp | 51,5 % | 40ᵉ / 57 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 49,2 % | 13ᵉ / 22 | llm-stats | Auto-déclaré |
| Multi-Challenge | 43,0 % | 20ᵉ / 28 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 14,7 % | 69ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 139ᵉ | MiniMax M2.5 | 1391 |
| 140ᵉ | GPT-5 mini | 1390 |
| 141ᵉ | o4-mini | 1390 |
| 142ᵉ | Claude Sonnet 4 | 1389 |
| 143ᵉ | o1-preview | 1388 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 60ᵉ | Mistral Large 3 | 1203 |
| 61ᵉ | GPT-4.1 mini | 1202 |
| 62ᵉ | o4-mini | 1201 |
| 63ᵉ | Mistral Medium 3.5 | 1199 |
| 64ᵉ | Grok 4.1 Fast | 1196 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 1,1 $ | 4,4 $ | 0,275 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 47 % en dessous de la moyenne des LLM similaires, et 5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,23 $ |
| Latence moyenne par benchmark — Benchable | 12 min 17 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, o4-mini appartenait au top 6% des LLM de sa génération sur GPQA diamond. Les mathématiques constituaient son principal atout : il figurait dans le top 10 du Math Index et atteignait la troisième place sur Epoch: MATH level 5. Ses résultats étaient également très élevés en connaissances générales, avec la première place sur Benchable General Knowledge, ainsi qu’en raisonnement et en classification d’e-mails. Sa fenêtre de 200 000 tokens autorisait le traitement de volumes de texte importants. Ce niveau s’accompagnait d’un coût particulièrement bas, nettement inférieur à celui des modèles similaires et des modèles frontière.
Limites et points d’attention. Son Intelligence Index ne le plaçait qu’au-delà du milieu du classement, signe d’un niveau général moins remarquable que ses résultats mathématiques. Les évaluations Arena confirmaient cette faiblesse relative : o4-mini se situait dans la partie basse en texte et dans la moitié inférieure en vision. Son score élevé en éthique masquait aussi un classement comparatif peu favorable. Près d’un an après sa sortie, ses performances sont largement dépassées à l’échelle du secteur, et un modèle de cette ancienneté est souvent retiré du catalogue de son éditeur. La limite de connaissances fixée à mai 2024 réduit en outre sa pertinence sur les informations récentes.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).