Kimi K2.6

Kimi K2.6 est un LLM chinois lancé par Moonshot AI le 20 avril 2026. Son architecture Mixture-of-Experts compte 1000 milliards de paramètres, dont 32 milliards actifs, avec une fenêtre de contexte de 262 144 tokens. Multimodal natif et agentique, il associe l’attention MLA, l’activation…

Kimi K2.6 est un LLM chinois lancé par Moonshot AI le 20 avril 2026. Son architecture Mixture-of-Experts compte 1000 milliards de paramètres, dont 32 milliards actifs, avec une fenêtre de contexte de 262 144 tokens. Multimodal natif et agentique, il associe l’attention MLA, l’activation SwiGLU et l’encodeur visuel MoonViT.

Le modèle cible le codage long, la création d’interfaces et de workflows full-stack à partir de texte ou d’images, ainsi que l’orchestration autonome de tâches. Son principal avantage commercial réside dans un tarif très économique, inférieur de 67% à la moyenne des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMoonshot AI
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
LicenceModified MIT License
Date de sortie20 avril 2026
Multimodaloui
Paramètres1000 milliards
Paramètres actifs32 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text,image,video → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index44.214ᵉ / 137
Code Index61.814ᵉ / 74
Agentic Index30.319ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
V*96,9 %1ᵉ / 7llm-statsAuto-déclaré
AIME 202696,4 %2ᵉ / 17llm-statsAuto-déclaré
MathVision93,2 %3ᵉ / 32llm-statsAuto-déclaré
HMMT Feb 2692,7 %5ᵉ / 11llm-statsAuto-déclaré
GPQA90,5 %17ᵉ / 219llm-statsAuto-déclaré
LiveCodeBench v689,6 %2ᵉ / 53llm-statsAuto-déclaré
CharXiv-R86,7 %7ᵉ / 45llm-statsAuto-déclaré
BrowseComp86,3 %6ᵉ / 57llm-statsAuto-déclaré
IMO-AnswerBench86,0 %7ᵉ / 19llm-statsAuto-déclaré
DeepSearchQA83,0 %6ᵉ / 8llm-statsAuto-déclaré
Claw-Eval80,9 %1ᵉ / 13llm-statsAuto-déclaré
WideSearch80,8 %1ᵉ / 9llm-statsAuto-déclaré
SWE-Bench Verified80,2 %12ᵉ / 102llm-statsAuto-déclaré
MMMU-Pro80,1 %13ᵉ / 64llm-statsAuto-déclaré
SWE-bench Multilingual76,7 %6ᵉ / 34llm-statsAuto-déclaré
OSWorld-Verified73,1 %11ᵉ / 19llm-statsAuto-déclaré
LiveBench72,2 %25ᵉ / 38llm-statsn.d.
BabyVision68,5 %5ᵉ / 9llm-statsAuto-déclaré
Terminal-Bench 2.066,7 %15ᵉ / 49llm-statsAuto-déclaré
OJBench60,6 %1ᵉ / 9llm-statsAuto-déclaré
SWE-Bench Pro58,6 %14ᵉ / 41llm-statsAuto-déclaré
MCP-Mark55,9 %4ᵉ / 8llm-statsAuto-déclaré
SciCode52,2 %5ᵉ / 18llm-statsAuto-déclaré
Toolathlon50,0 %13ᵉ / 30llm-statsAuto-déclaré
Finance Agent v244,9 %11ᵉ / 26llm-statsn.d.
GDPval-AA40,1 %22ᵉ / 39llm-statsn.d.
Humanity's Last Exam36,4 %37ᵉ / 89llm-statsAuto-déclaré
APEX-Agents27,9 %5ᵉ / 7llm-statsAuto-déclaré
FrontierSWE27,0 %12ᵉ / 14llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Kimi K2.644.2
DeepSeek V4 Pro40.8

Code Index

▶ Kimi K2.661.8

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Image-to-Code15199ᵉ / 31Claude Fable 5 (1627)
Arena Code151518ᵉ / 99Kimi K3 (1679)
Arena Text146137ᵉ / 200Claude Fable 5 (1507)
Arena Document144915ᵉ / 32Claude Opus 4.6 (1508)
Arena Vision126521ᵉ / 135Claude Fable 5 (1318)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Inceptron0,66 $3,41 $0,15 $
deepinfra0,75 $3,5 $n.d.
fireworks0,95 $4 $n.d.
together1,2 $4,5 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 68 % en dessous de la moyenne des LLM similaires, et 8,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,51 $
Latence moyenne par benchmark — Benchable36 min 08 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
PaysChina

Notre analyse

Forces. Kimi K2.6 obtient des résultats de premier plan en connaissances générales, en classification d’e-mails et en raisonnement, avec une place dans le top 10 sur ces trois évaluations Benchable. Il se distingue aussi sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée) et se classe dans le haut du tableau en Arena image-to-code. Son Code Index confirme un positionnement solide pour le développement, notamment en Rust, Go et Python, du front-end au DevOps et à l’optimisation des performances. À sa sortie, il figurait dans le top 12% des LLM de sa génération sur GPQA diamond. Son coût est environ 8,3 fois inférieur à celui des modèles frontière.

Limites et points d'attention. Les performances sont moins dominantes en usage conversationnel général, avec un classement plus éloigné de la tête en Arena text. L’Agentic Index reste également en retrait par rapport au Code Index, malgré le positionnement agentique du modèle. Les évaluations d’éthique et d’hallucinations affichent des scores absolus élevés, mais des rangs nettement moins favorables face aux modèles concurrents. Enfin, la licence Modified MIT License s’accompagne de poids non ouverts, ce qui limite l’intérêt du modèle pour les usages exigeant un accès direct aux paramètres. Kimi K2.6 vise surtout le codage, l’image-to-code, les longs contextes et les workflows autonomes à coût contenu.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).