Kimi K2 Thinking Turbo

Kimi K2 Thinking Turbo est un LLM de Moonshot AI, sorti le 6 novembre 2025. Il se distingue surtout par ses résultats en sciences de niveau doctorat et en olympiades de mathématiques de niveau lycée, deux domaines où il se place dans le haut des classements mesurés.

Kimi K2 Thinking Turbo est un LLM de Moonshot AI, sorti le 6 novembre 2025. Il se distingue surtout par ses résultats en sciences de niveau doctorat et en olympiades de mathématiques de niveau lycée, deux domaines où il se place dans le haut des classements mesurés.

À sa sortie, il appartenait au top 12% des LLM de sa génération sur GPQA diamond. Ce positionnement en faisait un modèle notable pour les tâches scientifiques et mathématiques, avec un profil nettement moins solide sur les questions factuelles vérifiables.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMoonshot AI
Poids▫ n.d.
Date de sortie6 novembre 2025

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond84,2 %17ᵉ / 85epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-202583,1 %19ᵉ / 64epoch✅ Mesuré
Epoch: SimpleQA Verified31,6 %18ᵉ / 26epoch✅ Mesuré
Epoch: Chess Puzzles20,0 %12ᵉ / 20epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public20,0 %11ᵉ / 33epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

▶ Kimi K2 Thinking Turbo84 %

Epoch: OTIS Mock AIME 2024-2025

▶ Kimi K2 Thinking Turbo83 %

Notre analyse

Forces. Kimi K2 Thinking Turbo atteint 84% sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat, et figure dans le haut du classement. Il obtient aussi 83% sur OTIS Mock AIME 2024-2025, qui évalue des problèmes d’olympiades de mathématiques de niveau lycée. Ces deux résultats cohérents dessinent un profil solide pour le traitement de questions scientifiques complexes et de problèmes mathématiques exigeants. À sa sortie, son classement sur GPQA diamond le situait dans le top 12% des LLM lancés au cours des 18 mois précédents.

Limites et points d'attention. Le résultat de 32% sur SimpleQA Verified place le modèle en retrait sur les questions factuelles vérifiables. La restitution précise de faits constitue donc sa faiblesse la plus nette dans cette sélection. Sur FrontierMath, consacré aux mathématiques de recherche très difficiles, il obtient 20% et partage la 11e place avec deux autres modèles. Il atteint également 20% sur Chess Puzzles et partage la 12e place avec deux autres modèles. Ces deux benchmarks sont plafonnés et leurs scores ne sont pas discriminants. Le modèle est surtout pertinent pour les usages centrés sur les sciences et les mathématiques, avec davantage de prudence pour les réponses factuelles.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.