o3

Sorti le 16 avril 2025, o3 est un LLM propriétaire d’OpenAI. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA. Il se caractérisait à sa sortie par de solides résultats en mathématiques et en sciences, ainsi que par une fenêtre de contexte de 200 000…

Sorti le 16 avril 2025, o3 est un LLM propriétaire d’OpenAI. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA. Il se caractérisait à sa sortie par de solides résultats en mathématiques et en sciences, ainsi que par une fenêtre de contexte de 200 000 tokens.

Son positionnement tarifaire est économique. Ses tarifs se situent 4% sous la moyenne des LLM similaires et environ 2,8 fois sous ceux des modèles frontière. Ses connaissances s’arrêtent au 31 mai 2024.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie16 avril 2025
Connaissances jusqu'à2024-05-31
Multimodaloui
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index30.459ᵉ / 137
Math Index88.311ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Reasoning (Baseline)100,0 %1ᵉ / 155benchable✅ Mesuré
Epoch: MATH level 597,8 %3ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-202583,9 %18ᵉ / 64epoch✅ Mesuré
Epoch: GPQA diamond81,8 %22ᵉ / 85epoch✅ Mesuré
Epoch: SWE-Bench verified62,3 %12ᵉ / 15epoch✅ Mesuré
Epoch: SimpleQA Verified53,0 %7ᵉ / 26epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private18,7 %12ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public10,0 %14ᵉ / 33epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private2,1 %15ᵉ / 25epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Public0,0 %1ᵉ / 15epoch✅ Mesuré
COLLIE98,4 %3ᵉ / 10llm-statsAuto-déclaré
AIME 202491,6 %6ᵉ / 52llm-statsAuto-déclaré
ARC-AGI88,0 %4ᵉ / 7llm-statsAuto-déclaré
MathVista86,8 %3ᵉ / 38llm-statsAuto-déclaré
AIME 202586,4 %53ᵉ / 108llm-statsAuto-déclaré
GPQA83,3 %59ᵉ / 219llm-statsAuto-déclaré
VideoMMMU83,3 %13ᵉ / 26llm-statsAuto-déclaré
MMMU82,9 %6ᵉ / 61llm-statsAuto-déclaré
Aider-Polyglot81,3 %3ᵉ / 22llm-statsAuto-déclaré
Tau2 Retail80,2 %8ᵉ / 25llm-statsAuto-déclaré
CharXiv-R78,6 %21ᵉ / 45llm-statsAuto-déclaré
MMMU-Pro76,4 %27ᵉ / 64llm-statsAuto-déclaré
SWE-Bench Verified69,1 %63ᵉ / 102llm-statsAuto-déclaré
Tau2 Airline64,8 %7ᵉ / 22llm-statsAuto-déclaré
ERQA64,0 %8ᵉ / 22llm-statsAuto-déclaré
Tau-bench63,0 %6ᵉ / 6llm-statsAuto-déclaré
Multi-Challenge60,4 %10ᵉ / 28llm-statsAuto-déclaré
Tau2 Telecom58,2 %29ᵉ / 34llm-statsAuto-déclaré
BrowseComp49,7 %43ᵉ / 57llm-statsAuto-déclaré
FrontierMath15,8 %12ᵉ / 16llm-statsAuto-déclaré
Humanity's Last Exam14,7 %69ᵉ / 89llm-statsAuto-déclaré
ARC-AGI v26,5 %15ᵉ / 16llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Qwen3.5 397B A17B32.0
▶ o330.4

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ o388.3

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
80ᵉkimi-k2.5-instant1431
81ᵉGrok 4.1 Fast1431
82ᵉo31431
83ᵉMiMo-V2-Omni1430
84ᵉKimi K2 09051430

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
50ᵉMiMo-V2-Omni1218
51ᵉernie-5.0-preview-12201218
52ᵉo31216
53ᵉQwen3 VL 235B A22B Instruct1215
54ᵉGemini 2.5 Flash1214

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
OpenAI2 $8 $0,5 $

Prix en dollars US par million de tokens.

Sa tarification se situe 4 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,19 $
Latence moyenne par benchmark — Benchable7 min 49 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. À sa sortie, o3 figurait dans le top 4% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Il reste dans le top 10 sur MATH level 5 et SimpleQA Verified, tandis que son Math Index le place parmi les modèles les plus solides en mathématiques. Son résultat sur OTIS Mock AIME 2024-2025 confirme de bonnes aptitudes aux olympiades de niveau lycée. Sur Reasoning (Baseline), il partage la première place avec 14 autres modèles, mais ce benchmark plafonné ne les départage pas.

Limites et points d’attention. Son Intelligence Index le situe en retrait, tout comme SWE-Bench verified, où il se classe près du bas du tableau sur la résolution de bugs GitHub. Dans l’Arena text, il reste derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. Le constat est similaire dans l’Arena vision, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. Le premier est là aussi nettement devant. Après environ un an, ses performances sont largement dépassées et cette génération est souvent retirée des catalogues. Pour un résultat Arena plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).