Kimi K2

Publié le 6 novembre 2025 par l’entreprise chinoise Moonshot AI, Kimi K2 est un LLM de 1000 milliards de paramètres, dont 32 milliards sont actifs. Ce rapport entre taille totale et paramètres mobilisés constitue l’un de ses principaux traits techniques.

Publié le 6 novembre 2025 par l’entreprise chinoise Moonshot AI, Kimi K2 est un LLM de 1000 milliards de paramètres, dont 32 milliards sont actifs. Ce rapport entre taille totale et paramètres mobilisés constitue l’un de ses principaux traits techniques.

Son entraînement représente 3,0 × 10²⁴ FLOP, soit environ 827 000 heures-GPU H100. Cette charge équivaut à près de 380 GPU H100 fonctionnant pendant trois mois. Kimi K2 affiche surtout un profil orienté vers les mathématiques, tandis que son niveau général le place dans une zone plus intermédiaire du classement.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMoonshot AI
Poids▫ n.d.
Date de sortie6 novembre 2025
Paramètres1000 milliards
Paramètres actifs32 milliards

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index32.749ᵉ / 137
Math Index94.73ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)95,0 %21ᵉ / 140benchable✅ Mesuré
Benchable : Hallucinations (Baseline)94,0 %78ᵉ / 146benchable✅ Mesuré
Benchable : Coding (Baseline)93,0 %42ᵉ / 162benchable✅ Mesuré
Benchable : Keyword Topic Relevance Classification90,0 %4ᵉ / 6benchable✅ Mesuré
Benchable : Reasoning (Baseline)86,0 %61ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)77,0 %34ᵉ / 163benchable✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public40,0 %7ᵉ / 33epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private21,4 %9ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Public0,0 %1ᵉ / 15epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private0,0 %20ᵉ / 25epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nemotron 3 Ultra 550B A…37.8
▶ Kimi K232.7
Qwen3.5 397B A17B32.0

Math Index

▶ Kimi K294.7
DeepSeek V3.292.0

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,02 $
Latence moyenne par benchmark — Benchable9 min 16 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement3,0 × 10²⁴ FLOP
Taille du jeu d'entraînement1,6 × 10¹³
Jeu de donnéesUnspecified unreleased
MatérielNVIDIA H800 SXM5
PaysChina

Notre analyse

Forces. Les mathématiques constituent le principal point fort de Kimi K2. Son Math Index le classe dans le top 10 et à la troisième place parmi les modèles évalués. Le modèle obtient aussi un résultat élevé sur Mathematics (Baseline), même si ce benchmark plafonné départage peu les meilleurs participants. Coding (Baseline) confirme des capacités solides en programmation, avec un score élevé et une place dans le premier tiers du classement. Email Classification (Baseline) figure également parmi ses résultats favorables, mais la place est partagée avec 40 autres modèles.

Limites et points d’attention. L’Intelligence Index situe Kimi K2 dans la partie intermédiaire du classement général, loin de son positionnement en mathématiques. Son résultat sur Hallucinations (Baseline) reste en retrait, avec une 78e place partagée sur 146 modèles. Les scores parfaits obtenus sur Ethics (Baseline) et General Knowledge (Baseline) sont peu discriminants : ces évaluations sont plafonnées et les places sont partagées avec de nombreux concurrents. Kimi K2 apparaît donc surtout pertinent pour les tâches à forte composante mathématique, ainsi que pour certains travaux de programmation et de classification d’e-mails.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).