o3-mini
Publié par OpenAI le 30 janvier 2025, o3-mini est un LLM propriétaire à poids non ouverts. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances doivent être replacées dans le contexte de sa sortie.
Publié par OpenAI le 30 janvier 2025, o3-mini est un LLM propriétaire à poids non ouverts. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances doivent être replacées dans le contexte de sa sortie.
À l’époque, o3-mini se classait dans le top 3% des modèles de sa génération sur GPQA diamond. Il associait de solides résultats en raisonnement et en mathématiques à une fenêtre de contexte de 200 000 tokens. Son autre argument reste son prix très économique, inférieur de 45% à la moyenne des LLM similaires et environ cinq fois moins élevé que celui des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 30 janvier 2025 |
| Connaissances jusqu'à | 2023-09-30 |
| Multimodal | non |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 19.0 | 107ᵉ / 137 |
| Code Index | 16.3 | 68ᵉ / 74 |
| Agentic Index | 1.7 | 61ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| COLLIE | 98,7 % | 2ᵉ / 10 | llm-stats | Auto-déclaré |
| MATH | 97,9 % | 1ᵉ / 70 | llm-stats | Auto-déclaré |
| IFEval | 93,9 % | 5ᵉ / 65 | llm-stats | Auto-déclaré |
| MGSM | 92,0 % | 2ᵉ / 30 | llm-stats | Auto-déclaré |
| AIME 2024 | 87,3 % | 12ᵉ / 52 | llm-stats | Auto-déclaré |
| MMLU | 86,9 % | 25ᵉ / 98 | llm-stats | Auto-déclaré |
| LiveBench | 84,6 % | 1ᵉ / 38 | llm-stats | Auto-déclaré |
| Multilingual MMLU | 80,7 % | 1ᵉ / 5 | llm-stats | Auto-déclaré |
| Multi-IF | 79,5 % | 2ᵉ / 20 | llm-stats | Auto-déclaré |
| GPQA | 77,2 % | 89ᵉ / 219 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 66,7 % | 9ᵉ / 22 | llm-stats | Auto-déclaré |
| Aider-Polyglot Edit | 60,4 % | 3ᵉ / 10 | llm-stats | Auto-déclaré |
| Graphwalks parents <128k | 58,3 % | 6ᵉ / 10 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 57,6 % | 20ᵉ / 24 | llm-stats | Auto-déclaré |
| Graphwalks BFS <128k | 51,0 % | 8ᵉ / 10 | llm-stats | Auto-déclaré |
| Internal API instruction following (hard) | 50,0 % | 3ᵉ / 7 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 49,3 % | 86ᵉ / 102 | llm-stats | Auto-déclaré |
| Multi-Challenge | 39,9 % | 22ᵉ / 28 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 32,4 % | 20ᵉ / 22 | llm-stats | Auto-déclaré |
| OpenAI-MRCR: 2 needle 128k | 18,7 % | 8ᵉ / 8 | llm-stats | Auto-déclaré |
| SWE-Lancer | 18,0 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| ComplexFuncBench | 17,6 % | 6ᵉ / 7 | llm-stats | Auto-déclaré |
| SimpleQA | 15,0 % | 36ᵉ / 45 | llm-stats | Auto-déclaré |
| FrontierMath | 9,2 % | 14ᵉ / 16 | llm-stats | Auto-déclaré |
| SWE-Lancer (IC-Diamond subset) | 7,4 % | 6ᵉ / 6 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 166ᵉ | Gemma 3 27B | 1366 |
| 167ᵉ | MiniMax M1 | 1364 |
| 168ᵉ | o3-mini | 1363 |
| 169ᵉ | Grok-3 Mini | 1362 |
| 170ᵉ | Nemotron 3 Super (120B A12B) | 1362 |
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 166ᵉ | Gemma 3 27B | 1366 |
| 167ᵉ | MiniMax M1 | 1364 |
| 168ᵉ | o3-mini | 1363 |
| 169ᵉ | Grok-3 Mini | 1362 |
| 170ᵉ | Nemotron 3 Super (120B A12B) | 1362 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 1,1 $ | 4,4 $ | 0,55 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 47 % en dessous de la moyenne des LLM similaires, et 5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,22 $ |
| Latence moyenne par benchmark — Benchable | 12 min 45 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. o3-mini excellait à sa sortie sur les tâches structurées de raisonnement. Il atteint le premier rang sur les évaluations General Knowledge et Reasoning de Benchable, et figure dans le top 10 sur MATH level 5. Son classement initial sur GPQA diamond le plaçait également dans le haut du panier de sa génération. La fenêtre de contexte de 200 000 tokens autorise le traitement de volumes de texte importants. Enfin, son positionnement tarifaire demeure très économique, avec un coût d’entrée de 1.1 $ par million de tokens et un coût de sortie de 4.4 $.
Limites et points d’attention. Les classements globaux sont nettement moins favorables que ses meilleurs benchmarks ciblés. L’Intelligence Index le situe dans le bas du classement, tandis que le Code Index et l’Agentic Index le placent près des dernières positions. Ses résultats dans Arena text sont également faibles face au panel évalué. Les scores en Ethics, Email Classification et Hallucinations s’accompagnent de rangs médiocres. Ses connaissances s’arrêtent au 30 septembre 2023. Environ un an après sa sortie, o3-mini est largement dépassé par les générations récentes et fait partie des modèles anciens souvent retirés du catalogue de leur éditeur.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).