Kimi K2 Thinking Turbo
Kimi K2 Thinking Turbo est un LLM de Moonshot AI, sorti le 6 novembre 2025. Il se distingue surtout par ses résultats en sciences de niveau doctorat et en olympiades de mathématiques de niveau lycée, deux domaines où il se place dans le haut des classements mesurés.
Kimi K2 Thinking Turbo est un LLM de Moonshot AI, sorti le 6 novembre 2025. Il se distingue surtout par ses résultats en sciences de niveau doctorat et en olympiades de mathématiques de niveau lycée, deux domaines où il se place dans le haut des classements mesurés.
À sa sortie, il appartenait au top 12% des LLM de sa génération sur GPQA diamond. Ce positionnement en faisait un modèle notable pour les tâches scientifiques et mathématiques, avec un profil nettement moins solide sur les questions factuelles vérifiables.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Moonshot AI |
| Poids | ▫ n.d. |
| Date de sortie | 6 novembre 2025 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: GPQA diamond | 84,2 % | 17ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 83,1 % | 19ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 31,6 % | 18ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 20,0 % | 12ᵉ / 20 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 20,0 % | 11ᵉ / 33 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: GPQA diamond
Epoch: OTIS Mock AIME 2024-2025
Notre analyse
Forces. Kimi K2 Thinking Turbo atteint 84% sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat, et figure dans le haut du classement. Il obtient aussi 83% sur OTIS Mock AIME 2024-2025, qui évalue des problèmes d’olympiades de mathématiques de niveau lycée. Ces deux résultats cohérents dessinent un profil solide pour le traitement de questions scientifiques complexes et de problèmes mathématiques exigeants. À sa sortie, son classement sur GPQA diamond le situait dans le top 12% des LLM lancés au cours des 18 mois précédents.
Limites et points d'attention. Le résultat de 32% sur SimpleQA Verified place le modèle en retrait sur les questions factuelles vérifiables. La restitution précise de faits constitue donc sa faiblesse la plus nette dans cette sélection. Sur FrontierMath, consacré aux mathématiques de recherche très difficiles, il obtient 20% et partage la 11e place avec deux autres modèles. Il atteint également 20% sur Chess Puzzles et partage la 12e place avec deux autres modèles. Ces deux benchmarks sont plafonnés et leurs scores ne sont pas discriminants. Le modèle est surtout pertinent pour les usages centrés sur les sciences et les mathématiques, avec davantage de prudence pour les réponses factuelles.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.