o1-mini

Publié par OpenAI le 12 septembre 2024, o1-mini est un LLM propriétaire dont les poids ne sont pas ouverts. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA, aujourd’hui probablement dépassée et souvent retirée des catalogues.

Publié par OpenAI le 12 septembre 2024, o1-mini est un LLM propriétaire dont les poids ne sont pas ouverts. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA, aujourd’hui probablement dépassée et souvent retirée des catalogues.

À son lancement, o1-mini se distinguait notamment sur les questions scientifiques complexes, avec une place dans le top 2% des LLM de sa génération sur GPQA diamond. Sa fenêtre de contexte atteint 128 000 tokens, tandis que ses connaissances s’arrêtent au 31 octobre 2023.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurOpenAI
Poids🔒 Propriétaire
Date de sortie12 septembre 2024
Multimodalnon
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
HumanEval92,4 %7ᵉ / 65llm-statsAuto-déclaré
MATH-50090,0 %27ᵉ / 31llm-statsAuto-déclaré
MMLU85,2 %39ᵉ / 98llm-statsAuto-déclaré
GPQA60,0 %146ᵉ / 219llm-statsAuto-déclaré
Cybersecurity CTFs28,7 %3ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
197ᵉhunyuan-turbo-01101341
198ᵉGPT-5 nano1337
199ᵉo1-mini1337
200ᵉNova 2 Lite1337

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. À sa sortie, o1-mini figurait dans le haut du panier de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. MATH level 5 reste son résultat le plus solide dans les évaluations disponibles, avec une place dans le premier cinquième du classement. Le modèle conserve aussi un niveau notable sur OTIS Mock AIME 2024-2025, qui mesure la résolution de problèmes d’olympiades mathématiques de niveau lycée. Sa fenêtre de 128 000 tokens autorise le traitement de volumes de texte importants au sein d’un même contexte.

Limites et points d’attention. Les classements actuels montrent un net décrochage par rapport aux modèles plus récents. o1-mini se situe presque en dernière position dans Arena text, et dans la moitié basse sur GPQA diamond comme sur OTIS Mock AIME. Ses résultats deviennent très faibles sur FrontierMath, consacré aux mathématiques de recherche particulièrement difficiles, avec 2% sur la version privée et 0% sur la version publique. Ses connaissances arrêtées à octobre 2023 accentuent son ancienneté. Le modèle est propriétaire, avec des poids non ouverts. À près de deux ans, ses performances sont largement dépassées et ce type de modèle ancien est souvent retiré du catalogue de son éditeur.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.