o3-mini

Publié par OpenAI le 30 janvier 2025, o3-mini est un LLM propriétaire à poids non ouverts. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances doivent être replacées dans le contexte de sa sortie.

Publié par OpenAI le 30 janvier 2025, o3-mini est un LLM propriétaire à poids non ouverts. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et ses performances doivent être replacées dans le contexte de sa sortie.

À l’époque, o3-mini se classait dans le top 3% des modèles de sa génération sur GPQA diamond. Il associait de solides résultats en raisonnement et en mathématiques à une fenêtre de contexte de 200 000 tokens. Son autre argument reste son prix très économique, inférieur de 45% à la moyenne des LLM similaires et environ cinq fois moins élevé que celui des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie30 janvier 2025
Connaissances jusqu'à2023-09-30
Multimodalnon
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index19.0107ᵉ / 137
Code Index16.368ᵉ / 74
Agentic Index1.761ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
COLLIE98,7 %2ᵉ / 10llm-statsAuto-déclaré
MATH97,9 %1ᵉ / 70llm-statsAuto-déclaré
IFEval93,9 %5ᵉ / 65llm-statsAuto-déclaré
MGSM92,0 %2ᵉ / 30llm-statsAuto-déclaré
AIME 202487,3 %12ᵉ / 52llm-statsAuto-déclaré
MMLU86,9 %25ᵉ / 98llm-statsAuto-déclaré
LiveBench84,6 %1ᵉ / 38llm-statsAuto-déclaré
Multilingual MMLU80,7 %1ᵉ / 5llm-statsAuto-déclaré
Multi-IF79,5 %2ᵉ / 20llm-statsAuto-déclaré
GPQA77,2 %89ᵉ / 219llm-statsAuto-déclaré
Aider-Polyglot66,7 %9ᵉ / 22llm-statsAuto-déclaré
Aider-Polyglot Edit60,4 %3ᵉ / 10llm-statsAuto-déclaré
Graphwalks parents <128k58,3 %6ᵉ / 10llm-statsAuto-déclaré
TAU-bench Retail57,6 %20ᵉ / 24llm-statsAuto-déclaré
Graphwalks BFS <128k51,0 %8ᵉ / 10llm-statsAuto-déclaré
Internal API instruction following (hard)50,0 %3ᵉ / 7llm-statsAuto-déclaré
SWE-Bench Verified49,3 %86ᵉ / 102llm-statsAuto-déclaré
Multi-Challenge39,9 %22ᵉ / 28llm-statsAuto-déclaré
TAU-bench Airline32,4 %20ᵉ / 22llm-statsAuto-déclaré
OpenAI-MRCR: 2 needle 128k18,7 %8ᵉ / 8llm-statsAuto-déclaré
SWE-Lancer18,0 %4ᵉ / 4llm-statsAuto-déclaré
ComplexFuncBench17,6 %6ᵉ / 7llm-statsAuto-déclaré
SimpleQA15,0 %36ᵉ / 45llm-statsAuto-déclaré
FrontierMath9,2 %14ᵉ / 16llm-statsAuto-déclaré
SWE-Lancer (IC-Diamond subset)7,4 %6ᵉ / 6llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nova 2.0 Pro Preview21.8
▶ o3-mini19.0

Code Index

▶ o3-mini16.3

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
166ᵉGemma 3 27B1366
167ᵉMiniMax M11364
168ᵉo3-mini1363
169ᵉGrok-3 Mini1362
170ᵉNemotron 3 Super (120B A12B)1362

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
166ᵉGemma 3 27B1366
167ᵉMiniMax M11364
168ᵉo3-mini1363
169ᵉGrok-3 Mini1362
170ᵉNemotron 3 Super (120B A12B)1362

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI1,1 $4,4 $0,55 $

Prix en dollars US par million de tokens.

Sa tarification se situe 47 % en dessous de la moyenne des LLM similaires, et 5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,22 $
Latence moyenne par benchmark — Benchable12 min 45 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. o3-mini excellait à sa sortie sur les tâches structurées de raisonnement. Il atteint le premier rang sur les évaluations General Knowledge et Reasoning de Benchable, et figure dans le top 10 sur MATH level 5. Son classement initial sur GPQA diamond le plaçait également dans le haut du panier de sa génération. La fenêtre de contexte de 200 000 tokens autorise le traitement de volumes de texte importants. Enfin, son positionnement tarifaire demeure très économique, avec un coût d’entrée de 1.1 $ par million de tokens et un coût de sortie de 4.4 $.

Limites et points d’attention. Les classements globaux sont nettement moins favorables que ses meilleurs benchmarks ciblés. L’Intelligence Index le situe dans le bas du classement, tandis que le Code Index et l’Agentic Index le placent près des dernières positions. Ses résultats dans Arena text sont également faibles face au panel évalué. Les scores en Ethics, Email Classification et Hallucinations s’accompagnent de rangs médiocres. Ses connaissances s’arrêtent au 30 septembre 2023. Environ un an après sa sortie, o3-mini est largement dépassé par les générations récentes et fait partie des modèles anciens souvent retirés du catalogue de leur éditeur.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).