o1-mini
Publié par OpenAI le 12 septembre 2024, o1-mini est un LLM propriétaire dont les poids ne sont pas ouverts. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA, aujourd’hui probablement dépassée et souvent retirée des catalogues.
Publié par OpenAI le 12 septembre 2024, o1-mini est un LLM propriétaire dont les poids ne sont pas ouverts. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA, aujourd’hui probablement dépassée et souvent retirée des catalogues.
À son lancement, o1-mini se distinguait notamment sur les questions scientifiques complexes, avec une place dans le top 2% des LLM de sa génération sur GPQA diamond. Sa fenêtre de contexte atteint 128 000 tokens, tandis que ses connaissances s’arrêtent au 31 octobre 2023.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 12 septembre 2024 |
| Multimodal | non |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| HumanEval | 92,4 % | 7ᵉ / 65 | llm-stats | Auto-déclaré |
| MATH-500 | 90,0 % | 27ᵉ / 31 | llm-stats | Auto-déclaré |
| MMLU | 85,2 % | 39ᵉ / 98 | llm-stats | Auto-déclaré |
| GPQA | 60,0 % | 146ᵉ / 219 | llm-stats | Auto-déclaré |
| Cybersecurity CTFs | 28,7 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 197ᵉ | hunyuan-turbo-0110 | 1341 |
| 198ᵉ | GPT-5 nano | 1337 |
| 199ᵉ | o1-mini | 1337 |
| 200ᵉ | Nova 2 Lite | 1337 |
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, o1-mini figurait dans le haut du panier de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. MATH level 5 reste son résultat le plus solide dans les évaluations disponibles, avec une place dans le premier cinquième du classement. Le modèle conserve aussi un niveau notable sur OTIS Mock AIME 2024-2025, qui mesure la résolution de problèmes d’olympiades mathématiques de niveau lycée. Sa fenêtre de 128 000 tokens autorise le traitement de volumes de texte importants au sein d’un même contexte.
Limites et points d’attention. Les classements actuels montrent un net décrochage par rapport aux modèles plus récents. o1-mini se situe presque en dernière position dans Arena text, et dans la moitié basse sur GPQA diamond comme sur OTIS Mock AIME. Ses résultats deviennent très faibles sur FrontierMath, consacré aux mathématiques de recherche particulièrement difficiles, avec 2% sur la version privée et 0% sur la version publique. Ses connaissances arrêtées à octobre 2023 accentuent son ancienneté. Le modèle est propriétaire, avec des poids non ouverts. À près de deux ans, ses performances sont largement dépassées et ce type de modèle ancien est souvent retiré du catalogue de son éditeur.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.