Kimi K2
Publié le 6 novembre 2025 par l’entreprise chinoise Moonshot AI, Kimi K2 est un LLM de 1000 milliards de paramètres, dont 32 milliards sont actifs. Ce rapport entre taille totale et paramètres mobilisés constitue l’un de ses principaux traits techniques.
Publié le 6 novembre 2025 par l’entreprise chinoise Moonshot AI, Kimi K2 est un LLM de 1000 milliards de paramètres, dont 32 milliards sont actifs. Ce rapport entre taille totale et paramètres mobilisés constitue l’un de ses principaux traits techniques.
Son entraînement représente 3,0 × 10²⁴ FLOP, soit environ 827 000 heures-GPU H100. Cette charge équivaut à près de 380 GPU H100 fonctionnant pendant trois mois. Kimi K2 affiche surtout un profil orienté vers les mathématiques, tandis que son niveau général le place dans une zone plus intermédiaire du classement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Moonshot AI |
| Poids | ▫ n.d. |
| Date de sortie | 6 novembre 2025 |
| Paramètres | 1000 milliards |
| Paramètres actifs | 32 milliards |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 32.7 | 49ᵉ / 137 |
| Math Index | 94.7 | 3ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 95,0 % | 21ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 94,0 % | 78ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 93,0 % | 42ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Keyword Topic Relevance Classification | 90,0 % | 4ᵉ / 6 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 86,0 % | 61ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 77,0 % | 34ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 40,0 % | 7ᵉ / 33 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 21,4 % | 9ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Public | 0,0 % | 1ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 0,0 % | 20ᵉ / 25 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,02 $ |
| Latence moyenne par benchmark — Benchable | 9 min 16 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 3,0 × 10²⁴ FLOP |
| Taille du jeu d'entraînement | 1,6 × 10¹³ |
| Jeu de données | Unspecified unreleased |
| Matériel | NVIDIA H800 SXM5 |
| Pays | China |
Notre analyse
Forces. Les mathématiques constituent le principal point fort de Kimi K2. Son Math Index le classe dans le top 10 et à la troisième place parmi les modèles évalués. Le modèle obtient aussi un résultat élevé sur Mathematics (Baseline), même si ce benchmark plafonné départage peu les meilleurs participants. Coding (Baseline) confirme des capacités solides en programmation, avec un score élevé et une place dans le premier tiers du classement. Email Classification (Baseline) figure également parmi ses résultats favorables, mais la place est partagée avec 40 autres modèles.
Limites et points d’attention. L’Intelligence Index situe Kimi K2 dans la partie intermédiaire du classement général, loin de son positionnement en mathématiques. Son résultat sur Hallucinations (Baseline) reste en retrait, avec une 78e place partagée sur 146 modèles. Les scores parfaits obtenus sur Ethics (Baseline) et General Knowledge (Baseline) sont peu discriminants : ces évaluations sont plafonnées et les places sont partagées avec de nombreux concurrents. Kimi K2 apparaît donc surtout pertinent pour les tâches à forte composante mathématique, ainsi que pour certains travaux de programmation et de classification d’e-mails.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).