o3
Sorti le 16 avril 2025, o3 est un LLM propriétaire d’OpenAI. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA. Il se caractérisait à sa sortie par de solides résultats en mathématiques et en sciences, ainsi que par une fenêtre de contexte de 200 000…
Sorti le 16 avril 2025, o3 est un LLM propriétaire d’OpenAI. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA. Il se caractérisait à sa sortie par de solides résultats en mathématiques et en sciences, ainsi que par une fenêtre de contexte de 200 000 tokens.
Son positionnement tarifaire est économique. Ses tarifs se situent 4% sous la moyenne des LLM similaires et environ 2,8 fois sous ceux des modèles frontière. Ses connaissances s’arrêtent au 31 mai 2024.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 16 avril 2025 |
| Connaissances jusqu'à | 2024-05-31 |
| Multimodal | oui |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 30.4 | 59ᵉ / 137 |
| Math Index | 88.3 | 11ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Reasoning (Baseline) | 100,0 % | 1ᵉ / 155 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 97,8 % | 3ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 83,9 % | 18ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 81,8 % | 22ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: SWE-Bench verified | 62,3 % | 12ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 53,0 % | 7ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 18,7 % | 12ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 10,0 % | 14ᵉ / 33 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 2,1 % | 15ᵉ / 25 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Public | 0,0 % | 1ᵉ / 15 | epoch | ✅ Mesuré |
| COLLIE | 98,4 % | 3ᵉ / 10 | llm-stats | Auto-déclaré |
| AIME 2024 | 91,6 % | 6ᵉ / 52 | llm-stats | Auto-déclaré |
| ARC-AGI | 88,0 % | 4ᵉ / 7 | llm-stats | Auto-déclaré |
| MathVista | 86,8 % | 3ᵉ / 38 | llm-stats | Auto-déclaré |
| AIME 2025 | 86,4 % | 53ᵉ / 108 | llm-stats | Auto-déclaré |
| GPQA | 83,3 % | 59ᵉ / 219 | llm-stats | Auto-déclaré |
| VideoMMMU | 83,3 % | 13ᵉ / 26 | llm-stats | Auto-déclaré |
| MMMU | 82,9 % | 6ᵉ / 61 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 81,3 % | 3ᵉ / 22 | llm-stats | Auto-déclaré |
| Tau2 Retail | 80,2 % | 8ᵉ / 25 | llm-stats | Auto-déclaré |
| CharXiv-R | 78,6 % | 21ᵉ / 45 | llm-stats | Auto-déclaré |
| MMMU-Pro | 76,4 % | 27ᵉ / 64 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 69,1 % | 63ᵉ / 102 | llm-stats | Auto-déclaré |
| Tau2 Airline | 64,8 % | 7ᵉ / 22 | llm-stats | Auto-déclaré |
| ERQA | 64,0 % | 8ᵉ / 22 | llm-stats | Auto-déclaré |
| Tau-bench | 63,0 % | 6ᵉ / 6 | llm-stats | Auto-déclaré |
| Multi-Challenge | 60,4 % | 10ᵉ / 28 | llm-stats | Auto-déclaré |
| Tau2 Telecom | 58,2 % | 29ᵉ / 34 | llm-stats | Auto-déclaré |
| BrowseComp | 49,7 % | 43ᵉ / 57 | llm-stats | Auto-déclaré |
| FrontierMath | 15,8 % | 12ᵉ / 16 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 14,7 % | 69ᵉ / 89 | llm-stats | Auto-déclaré |
| ARC-AGI v2 | 6,5 % | 15ᵉ / 16 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 80ᵉ | kimi-k2.5-instant | 1431 |
| 81ᵉ | Grok 4.1 Fast | 1431 |
| 82ᵉ | o3 | 1431 |
| 83ᵉ | MiMo-V2-Omni | 1430 |
| 84ᵉ | Kimi K2 0905 | 1430 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 50ᵉ | MiMo-V2-Omni | 1218 |
| 51ᵉ | ernie-5.0-preview-1220 | 1218 |
| 52ᵉ | o3 | 1216 |
| 53ᵉ | Qwen3 VL 235B A22B Instruct | 1215 |
| 54ᵉ | Gemini 2.5 Flash | 1214 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 2 $ | 8 $ | 0,5 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 4 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,19 $ |
| Latence moyenne par benchmark — Benchable | 7 min 49 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, o3 figurait dans le top 4% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Il reste dans le top 10 sur MATH level 5 et SimpleQA Verified, tandis que son Math Index le place parmi les modèles les plus solides en mathématiques. Son résultat sur OTIS Mock AIME 2024-2025 confirme de bonnes aptitudes aux olympiades de niveau lycée. Sur Reasoning (Baseline), il partage la première place avec 14 autres modèles, mais ce benchmark plafonné ne les départage pas.
Limites et points d’attention. Son Intelligence Index le situe en retrait, tout comme SWE-Bench verified, où il se classe près du bas du tableau sur la résolution de bugs GitHub. Dans l’Arena text, il reste derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. Le constat est similaire dans l’Arena vision, derrière Claude Fable 5, Claude Opus 4.7 et Claude Opus 4.6. Le premier est là aussi nettement devant. Après environ un an, ses performances sont largement dépassées et cette génération est souvent retirée des catalogues. Pour un résultat Arena plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).