o1-preview

Publié par OpenAI le 12 septembre 2024, o1-preview est un LLM propriétaire positionné sur le segment premium. Près de deux ans plus tard, il appartient à une génération déjà très ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et susceptible d’avoir…

Publié par OpenAI le 12 septembre 2024, o1-preview est un LLM propriétaire positionné sur le segment premium. Près de deux ans plus tard, il appartient à une génération déjà très ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et susceptible d’avoir quitté le catalogue courant de l’éditeur.

Sa fenêtre de contexte de 128 000 tokens reste notable, mais ses connaissances s’arrêtent au 31 octobre 2023. À son lancement, o1-preview se distinguait surtout par ses résultats en raisonnement scientifique et mathématique, avec une place dans le top 13% de sa génération sur GPQA diamond.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie12 septembre 2024
Multimodalnon
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index17.0110ᵉ / 137
Code Index34.054ᵉ / 74

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MGSM90,8 %5ᵉ / 30llm-statsAuto-déclaré
MMLU90,8 %3ᵉ / 98llm-statsAuto-déclaré
MATH85,5 %12ᵉ / 70llm-statsAuto-déclaré
GPQA73,3 %104ᵉ / 219llm-statsAuto-déclaré
LiveBench52,3 %34ᵉ / 38llm-statsAuto-déclaré
SimpleQA42,4 %20ᵉ / 45llm-statsAuto-déclaré
AIME 202442,0 %48ᵉ / 52llm-statsAuto-déclaré
SWE-Bench Verified41,3 %91ᵉ / 102llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nova 2.0 Pro Preview21.8
▶ o1-preview17.0

Code Index

Qwen3.5 122B A10B43.3
▶ o1-preview34.0
Nova 2.0 Pro Preview34.0

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
141ᵉo4-mini1390
142ᵉClaude Sonnet 41389
143ᵉo1-preview1388
144ᵉQwen3-Coder 480B A35B Instruct1388
145ᵉMiMo-V2-Flash1387

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. À sa sortie, o1-preview figurait dans le haut du panier de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. Son résultat sur MATH level 5 le place encore dans le premier tiers du classement observé, ce qui confirme une aptitude marquée pour les problèmes mathématiques difficiles. Sa fenêtre de 128 000 tokens autorise aussi le traitement de volumes de texte importants. Ces caractéristiques expliquent son positionnement initial parmi les modèles avancés d’OpenAI.

Limites et points d’attention. Les classements actuels montrent un net recul relatif. L’Intelligence Index se situe dans le bas du tableau, tandis que GPQA diamond, OTIS Mock AIME 2024-2025 et Arena text placent désormais o1-preview derrière une large part des modèles évalués. Le Code Index est moins défavorable, sans atteindre les premières places. Son ancienneté et sa limite de connaissances à octobre 2023 réduisent encore sa pertinence actuelle. Le coût constitue un frein majeur : sa tarification dépasse de 728% la moyenne des LLM similaires et reste environ trois fois supérieure à celle des modèles frontière. Ses poids propriétaires excluent enfin un déploiement ouvert.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.