Kimi K2 Instruct

Publié par Moonshot AI le 11 juillet 2025, Kimi K2 Instruct est un LLM open weights sous licence MIT, utilisable commercialement. Cette variante post-entraînée de Kimi K2 repose sur une architecture Mixture-of-Experts totalisant 1000 milliards de paramètres, dont 32 milliards sont activés.

Publié par Moonshot AI le 11 juillet 2025, Kimi K2 Instruct est un LLM open weights sous licence MIT, utilisable commercialement. Cette variante post-entraînée de Kimi K2 repose sur une architecture Mixture-of-Experts totalisant 1000 milliards de paramètres, dont 32 milliards sont activés.

Le modèle se distingue par un positionnement très économique et une fenêtre de contexte annoncée à 200 000 tokens. Il cible le chat général et les usages agentiques, avec raisonnement, codage, appel d’outils et résolution autonome de problèmes. Ses connaissances s’arrêtent au 31 décembre 2024.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMoonshot AI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie11 juillet 2025
Multimodalnon
Paramètres1000 milliards
Fenêtre de contexte200 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MATH-50097,4 %6ᵉ / 31llm-statsAuto-déclaré
GSM8k97,3 %2ᵉ / 47llm-statsAuto-déclaré
HumanEval93,3 %5ᵉ / 65llm-statsAuto-déclaré
MMLU-Redux92,7 %16ᵉ / 48llm-statsAuto-déclaré
IFEval89,8 %16ᵉ / 65llm-statsAuto-déclaré
MMLU89,5 %12ᵉ / 98llm-statsAuto-déclaré
ZebraLogic89,0 %5ᵉ / 7llm-statsAuto-déclaré
MultiPL-E85,7 %4ᵉ / 13llm-statsAuto-déclaré
MMLU-Pro81,1 %44ᵉ / 125llm-statsAuto-déclaré
CSimpleQA78,4 %5ᵉ / 7llm-statsAuto-déclaré
LiveBench76,4 %9ᵉ / 38llm-statsAuto-déclaré
GPQA75,1 %96ᵉ / 219llm-statsAuto-déclaré
CNMO 202474,3 %1ᵉ / 3llm-statsAuto-déclaré
Tau2 Retail70,6 %19ᵉ / 25llm-statsAuto-déclaré
AIME 202469,6 %40ᵉ / 52llm-statsAuto-déclaré
Tau2 Telecom65,8 %26ᵉ / 34llm-statsAuto-déclaré
Aider-Polyglot60,0 %12ᵉ / 22llm-statsAuto-déclaré
SuperGPQA57,2 %21ᵉ / 34llm-statsAuto-déclaré
Tau2 Airline56,5 %15ᵉ / 22llm-statsAuto-déclaré
Multi-Challenge54,1 %14ᵉ / 28llm-statsAuto-déclaré
LiveCodeBench v653,7 %42ᵉ / 53llm-statsAuto-déclaré
AIME 202549,5 %96ᵉ / 108llm-statsAuto-déclaré
SWE-bench Multilingual47,3 %30ᵉ / 34llm-statsAuto-déclaré
HMMT 202538,8 %29ᵉ / 33llm-statsAuto-déclaré
SimpleQA31,0 %24ᵉ / 45llm-statsAuto-déclaré
Terminal-Bench30,0 %20ᵉ / 25llm-statsAuto-déclaré
OJBench27,1 %8ᵉ / 9llm-statsAuto-déclaré
Humanity's Last Exam4,7 %87ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
NovitaAI0,57 $2,3 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 73 % en dessous de la moyenne des LLM similaires, et 9,6 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Notre analyse

Forces. À sa sortie, Kimi K2 Instruct figurait dans le top 22 % des 116 LLM de sa génération sur GPQA, un benchmark consacré aux questions scientifiques complexes. Son architecture combine Mixture-of-Experts, attention MLA et activation SwiGLU, avec 32 milliards de paramètres actifs sur un total de 1000 milliards. Le modèle prend en charge le chat, le codage, le raisonnement, l’usage d’outils et les expériences agentiques. Sa licence MIT autorise l’usage commercial. Son principal avantage économique reste son tarif, inférieur de 71 % à la moyenne des LLM similaires et environ 9,6 fois moins élevé que celui des modèles frontière.

Limites et points d'attention. Kimi K2 Instruct ne propose pas de mode de longue réflexion, ce qui le distingue des modèles conçus pour prolonger explicitement leur raisonnement. Deux longueurs de contexte lui sont associées : une fenêtre indiquée à 200 000 tokens et une longueur technique de 128K. Son classement GPQA le plaçait dans le haut du panier de sa génération, sans atteindre le groupe de tête. La coupure des connaissances au 31 décembre 2024 limite aussi la couverture des événements ultérieurs. Le modèle convient surtout aux usages de chat, de code et d’agents recherchant des poids ouverts, une licence commerciale permissive et des coûts d’inférence très contenus.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).