o1-preview
Publié par OpenAI le 12 septembre 2024, o1-preview est un LLM propriétaire positionné sur le segment premium. Près de deux ans plus tard, il appartient à une génération déjà très ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et susceptible d’avoir…
Publié par OpenAI le 12 septembre 2024, o1-preview est un LLM propriétaire positionné sur le segment premium. Près de deux ans plus tard, il appartient à une génération déjà très ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et susceptible d’avoir quitté le catalogue courant de l’éditeur.
Sa fenêtre de contexte de 128 000 tokens reste notable, mais ses connaissances s’arrêtent au 31 octobre 2023. À son lancement, o1-preview se distinguait surtout par ses résultats en raisonnement scientifique et mathématique, avec une place dans le top 13% de sa génération sur GPQA diamond.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 12 septembre 2024 |
| Multimodal | non |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 17.0 | 110ᵉ / 137 |
| Code Index | 34.0 | 54ᵉ / 74 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MGSM | 90,8 % | 5ᵉ / 30 | llm-stats | Auto-déclaré |
| MMLU | 90,8 % | 3ᵉ / 98 | llm-stats | Auto-déclaré |
| MATH | 85,5 % | 12ᵉ / 70 | llm-stats | Auto-déclaré |
| GPQA | 73,3 % | 104ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveBench | 52,3 % | 34ᵉ / 38 | llm-stats | Auto-déclaré |
| SimpleQA | 42,4 % | 20ᵉ / 45 | llm-stats | Auto-déclaré |
| AIME 2024 | 42,0 % | 48ᵉ / 52 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 41,3 % | 91ᵉ / 102 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 141ᵉ | o4-mini | 1390 |
| 142ᵉ | Claude Sonnet 4 | 1389 |
| 143ᵉ | o1-preview | 1388 |
| 144ᵉ | Qwen3-Coder 480B A35B Instruct | 1388 |
| 145ᵉ | MiMo-V2-Flash | 1387 |
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, o1-preview figurait dans le haut du panier de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. Son résultat sur MATH level 5 le place encore dans le premier tiers du classement observé, ce qui confirme une aptitude marquée pour les problèmes mathématiques difficiles. Sa fenêtre de 128 000 tokens autorise aussi le traitement de volumes de texte importants. Ces caractéristiques expliquent son positionnement initial parmi les modèles avancés d’OpenAI.
Limites et points d’attention. Les classements actuels montrent un net recul relatif. L’Intelligence Index se situe dans le bas du tableau, tandis que GPQA diamond, OTIS Mock AIME 2024-2025 et Arena text placent désormais o1-preview derrière une large part des modèles évalués. Le Code Index est moins défavorable, sans atteindre les premières places. Son ancienneté et sa limite de connaissances à octobre 2023 réduisent encore sa pertinence actuelle. Le coût constitue un frein majeur : sa tarification dépasse de 728% la moyenne des LLM similaires et reste environ trois fois supérieure à celle des modèles frontière. Ses poids propriétaires excluent enfin un déploiement ouvert.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.