Kimi K2.6
Kimi K2.6 est un LLM chinois lancé par Moonshot AI le 20 avril 2026. Son architecture Mixture-of-Experts compte 1000 milliards de paramètres, dont 32 milliards actifs, avec une fenêtre de contexte de 262 144 tokens. Multimodal natif et agentique, il associe l’attention MLA, l’activation…
Kimi K2.6 est un LLM chinois lancé par Moonshot AI le 20 avril 2026. Son architecture Mixture-of-Experts compte 1000 milliards de paramètres, dont 32 milliards actifs, avec une fenêtre de contexte de 262 144 tokens. Multimodal natif et agentique, il associe l’attention MLA, l’activation SwiGLU et l’encodeur visuel MoonViT.
Le modèle cible le codage long, la création d’interfaces et de workflows full-stack à partir de texte ou d’images, ainsi que l’orchestration autonome de tâches. Son principal avantage commercial réside dans un tarif très économique, inférieur de 67% à la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Moonshot AI |
| Poids | 🟢 Poids ouverts · usage commercial restreint (recherche / non commercial) |
| Licence | Modified MIT License |
| Date de sortie | 20 avril 2026 |
| Multimodal | oui |
| Paramètres | 1000 milliards |
| Paramètres actifs | 32 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,image,video → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 44.2 | 14ᵉ / 137 |
| Code Index | 61.8 | 14ᵉ / 74 |
| Agentic Index | 30.3 | 19ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| V* | 96,9 % | 1ᵉ / 7 | llm-stats | Auto-déclaré |
| AIME 2026 | 96,4 % | 2ᵉ / 17 | llm-stats | Auto-déclaré |
| MathVision | 93,2 % | 3ᵉ / 32 | llm-stats | Auto-déclaré |
| HMMT Feb 26 | 92,7 % | 5ᵉ / 11 | llm-stats | Auto-déclaré |
| GPQA | 90,5 % | 17ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 89,6 % | 2ᵉ / 53 | llm-stats | Auto-déclaré |
| CharXiv-R | 86,7 % | 7ᵉ / 45 | llm-stats | Auto-déclaré |
| BrowseComp | 86,3 % | 6ᵉ / 57 | llm-stats | Auto-déclaré |
| IMO-AnswerBench | 86,0 % | 7ᵉ / 19 | llm-stats | Auto-déclaré |
| DeepSearchQA | 83,0 % | 6ᵉ / 8 | llm-stats | Auto-déclaré |
| Claw-Eval | 80,9 % | 1ᵉ / 13 | llm-stats | Auto-déclaré |
| WideSearch | 80,8 % | 1ᵉ / 9 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 80,2 % | 12ᵉ / 102 | llm-stats | Auto-déclaré |
| MMMU-Pro | 80,1 % | 13ᵉ / 64 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 76,7 % | 6ᵉ / 34 | llm-stats | Auto-déclaré |
| OSWorld-Verified | 73,1 % | 11ᵉ / 19 | llm-stats | Auto-déclaré |
| LiveBench | 72,2 % | 25ᵉ / 38 | llm-stats | n.d. |
| BabyVision | 68,5 % | 5ᵉ / 9 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 66,7 % | 15ᵉ / 49 | llm-stats | Auto-déclaré |
| OJBench | 60,6 % | 1ᵉ / 9 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 58,6 % | 14ᵉ / 41 | llm-stats | Auto-déclaré |
| MCP-Mark | 55,9 % | 4ᵉ / 8 | llm-stats | Auto-déclaré |
| SciCode | 52,2 % | 5ᵉ / 18 | llm-stats | Auto-déclaré |
| Toolathlon | 50,0 % | 13ᵉ / 30 | llm-stats | Auto-déclaré |
| Finance Agent v2 | 44,9 % | 11ᵉ / 26 | llm-stats | n.d. |
| GDPval-AA | 40,1 % | 22ᵉ / 39 | llm-stats | n.d. |
| Humanity's Last Exam | 36,4 % | 37ᵉ / 89 | llm-stats | Auto-déclaré |
| APEX-Agents | 27,9 % | 5ᵉ / 7 | llm-stats | Auto-déclaré |
| FrontierSWE | 27,0 % | 12ᵉ / 14 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Image-to-Code | 1519 | 9ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Code | 1515 | 18ᵉ / 99 | Kimi K3 (1679) |
| Arena Text | 1461 | 37ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Document | 1449 | 15ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Vision | 1265 | 21ᵉ / 135 | Claude Fable 5 (1318) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Inceptron | 0,66 $ | 3,41 $ | 0,15 $ |
| deepinfra | 0,75 $ | 3,5 $ | n.d. |
| fireworks | 0,95 $ | 4 $ | n.d. |
| together | 1,2 $ | 4,5 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 68 % en dessous de la moyenne des LLM similaires, et 8,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,51 $ |
| Latence moyenne par benchmark — Benchable | 36 min 08 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | China |
Notre analyse
Forces. Kimi K2.6 obtient des résultats de premier plan en connaissances générales, en classification d’e-mails et en raisonnement, avec une place dans le top 10 sur ces trois évaluations Benchable. Il se distingue aussi sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée) et se classe dans le haut du tableau en Arena image-to-code. Son Code Index confirme un positionnement solide pour le développement, notamment en Rust, Go et Python, du front-end au DevOps et à l’optimisation des performances. À sa sortie, il figurait dans le top 12% des LLM de sa génération sur GPQA diamond. Son coût est environ 8,3 fois inférieur à celui des modèles frontière.
Limites et points d'attention. Les performances sont moins dominantes en usage conversationnel général, avec un classement plus éloigné de la tête en Arena text. L’Agentic Index reste également en retrait par rapport au Code Index, malgré le positionnement agentique du modèle. Les évaluations d’éthique et d’hallucinations affichent des scores absolus élevés, mais des rangs nettement moins favorables face aux modèles concurrents. Enfin, la licence Modified MIT License s’accompagne de poids non ouverts, ce qui limite l’intérêt du modèle pour les usages exigeant un accès direct aux paramètres. Kimi K2.6 vise surtout le codage, l’image-to-code, les longs contextes et les workflows autonomes à coût contenu.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).