o1-pro
Publié le 17 décembre 2024 par OpenAI, o1-pro est un LLM propriétaire américain positionné sur le segment premium. À sa sortie, il figurait dans le top 4% des modèles de sa génération sur GPQA, un résultat qui le plaçait alors parmi les systèmes les plus performants en raisonnement…
Publié le 17 décembre 2024 par OpenAI, o1-pro est un LLM propriétaire américain positionné sur le segment premium. À sa sortie, il figurait dans le top 4% des modèles de sa génération sur GPQA, un résultat qui le plaçait alors parmi les systèmes les plus performants en raisonnement évalués par ce benchmark.
Près de deux ans plus tard, o1-pro est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents. Il conserve toutefois deux caractéristiques notables dans une perspective historique : une fenêtre de contexte de 200 000 tokens et un coût d’utilisation exceptionnellement élevé.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 17 décembre 2024 |
| Connaissances jusqu'à | 2023-09-30 |
| Multimodal | oui |
| Fenêtre de contexte | 200 000 tokens |
| Modalités (entrée → sortie) | text,image,file → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2024 | 86,0 % | 15ᵉ / 52 | llm-stats | Auto-déclaré |
| GPQA | 79,0 % | 83ᵉ / 219 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| OpenAI | 150 $ | 600 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 7093 % au-dessus de la moyenne des LLM similaires, et 27,3 fois plus cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 35,61 $ |
| Latence moyenne par benchmark — Benchable | 1 h 18 min |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. À son lancement, o1-pro se distinguait surtout par son classement sur GPQA, dans le haut du panier des LLM de sa génération. Les évaluations Benchable montrent également un bon suivi des consignes, avec une place proche du premier huitième du classement sur Instruction Following. La classification d’e-mails constitue son meilleur résultat brut. Sa fenêtre de 200 000 tokens autorise par ailleurs le traitement de volumes de texte importants au sein d’un même contexte.
Limites et points d’attention. Son âge pèse fortement sur sa pertinence actuelle : ses performances sont aujourd’hui largement dépassées, et les modèles de cette période sont souvent retirés des catalogues des éditeurs. Ses connaissances s’arrêtent au 30 septembre 2023. Les résultats en programmation et en éthique le placent dans le bas des classements Benchable, loin de ses performances en suivi d’instructions. Son tarif constitue enfin un obstacle majeur : 150 $ par million de tokens en entrée et 600 $ en sortie, soit 7431% au-dessus de la moyenne des LLM similaires et environ 27.3 fois le prix des modèles frontière. Les poids restent fermés sous licence propriétaire.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).