Kimi K2.5
Développé en Chine par Moonshot AI et sorti le 27 janvier 2026, Kimi K2.5 est un LLM multimodal et agentique à poids ouverts sous licence MIT, avec usage commercial autorisé. Son architecture Mixture-of-Experts compte 1000 milliards de paramètres, dont 32 milliards actifs, et accepte un…
Développé en Chine par Moonshot AI et sorti le 27 janvier 2026, Kimi K2.5 est un LLM multimodal et agentique à poids ouverts sous licence MIT, avec usage commercial autorisé. Son architecture Mixture-of-Experts compte 1000 milliards de paramètres, dont 32 milliards actifs, et accepte un contexte de 262 144 tokens.
Le modèle traite conjointement texte et images, propose des modes instant et thinking, utilise des outils à partir d’entrées visuelles et génère du code depuis des spécifications visuelles. Son entraînement représente 5,8 × 10²⁴ FLOP, soit environ 1,6 million d’heures-GPU H100, l’équivalent de 750 GPU H100 mobilisés pendant trois mois.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Moonshot AI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 27 janvier 2026 |
| Multimodal | oui |
| Paramètres | 1000 milliards |
| Paramètres actifs | 32 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,image,video → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 38.1 | 28ᵉ / 137 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 96,1 % | 17ᵉ / 108 | llm-stats | Auto-déclaré |
| HMMT 2025 | 95,4 % | 6ᵉ / 33 | llm-stats | Auto-déclaré |
| InfoVQAtest | 92,6 % | 1ᵉ / 12 | llm-stats | Auto-déclaré |
| OCRBench | 92,3 % | 1ᵉ / 22 | llm-stats | Auto-déclaré |
| MathVista-Mini | 90,1 % | 1ᵉ / 23 | llm-stats | Auto-déclaré |
| OmniDocBench 1.5 | 88,8 % | 9ᵉ / 13 | llm-stats | Auto-déclaré |
| GPQA | 87,6 % | 33ᵉ / 219 | llm-stats | Auto-déclaré |
| Video-MME | 87,4 % | 5ᵉ / 17 | llm-stats | Auto-déclaré |
| MMLU-Pro | 87,1 % | 7ᵉ / 125 | llm-stats | Auto-déclaré |
| VideoMMMU | 86,6 % | 3ᵉ / 26 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 85,0 % | 9ᵉ / 53 | llm-stats | Auto-déclaré |
| MathVision | 84,2 % | 10ᵉ / 32 | llm-stats | Auto-déclaré |
| IMO-AnswerBench | 81,8 % | 13ᵉ / 19 | llm-stats | Auto-déclaré |
| MMVU | 80,4 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| LongVideoBench | 79,8 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| WideSearch | 79,0 % | 2ᵉ / 9 | llm-stats | Auto-déclaré |
| MMMU-Pro | 78,5 % | 17ᵉ / 64 | llm-stats | Auto-déclaré |
| CharXiv-R | 77,5 % | 24ᵉ / 45 | llm-stats | Auto-déclaré |
| DeepSearchQA | 77,1 % | 7ᵉ / 8 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 76,8 % | 27ᵉ / 102 | llm-stats | Auto-déclaré |
| LVBench | 75,9 % | 4ᵉ / 23 | llm-stats | Auto-déclaré |
| BrowseComp | 74,9 % | 25ᵉ / 57 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 73,0 % | 13ᵉ / 34 | llm-stats | Auto-déclaré |
| SimpleVQA | 71,2 % | 5ᵉ / 13 | llm-stats | Auto-déclaré |
| MotionBench | 70,4 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| AA-LCR | 70,0 % | 3ᵉ / 15 | llm-stats | Auto-déclaré |
| LiveBench | 69,1 % | 32ᵉ / 38 | llm-stats | n.d. |
| LongBench v2 | 61,0 % | 4ᵉ / 15 | llm-stats | Auto-déclaré |
| Seal-0 | 57,4 % | 1ᵉ / 6 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 50,8 % | 35ᵉ / 49 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 50,7 % | 39ᵉ / 41 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 50,2 % | 19ᵉ / 89 | llm-stats | Auto-déclaré |
| SciCode | 48,7 % | 7ᵉ / 18 | llm-stats | Auto-déclaré |
| WorldVQA | 46,3 % | 5ᵉ / 5 | llm-stats | Auto-déclaré |
| CyberGym | 41,3 % | 9ᵉ / 9 | llm-stats | Auto-déclaré |
| FrontierSWE | 26,0 % | 13ᵉ / 14 | llm-stats | n.d. |
| ZEROBench | 11,0 % | 5ᵉ / 9 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1450 | 52ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Image-to-Code | 1439 | 21ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Code | 1433 | 40ᵉ / 99 | Kimi K3 (1679) |
| Arena Document | 1431 | 22ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Vision | 1246 | 33ᵉ / 135 | Claude Fable 5 (1318) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DigitalOcean | 0,375 $ | 2,025 $ | 0,203 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 82 % en dessous de la moyenne des LLM similaires, et 14,7 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 7,15 $ |
| Durée d'exécution — PinchBench | 6 h 02 min |
| Indice valeur/coût — PinchBench | 29,62 |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 5,8 × 10²⁴ FLOP |
| Matériel | NVIDIA H800 SXM5 |
| Pays | China |
Notre analyse
Forces. Kimi K2.5 excelle surtout en raisonnement mathématique de niveau lycée sur OTIS Mock AIME et en questions scientifiques de niveau doctorat sur GPQA diamond. À sa sortie, il figurait dans le top 9% des LLM de sa génération sur ce dernier test. SWE-Bench verified confirme aussi de solides aptitudes à résoudre de vrais bugs GitHub. Son architecture associe l’attention MLA, l’activation SwiGLU et l’encodeur visuel MoonViT. Elle prend en charge la compréhension vision-langage, les échanges conversationnels, l’usage d’outils et la décomposition de tâches complexes entre plusieurs agents parallèles. Son tarif est très économique, 81% sous la moyenne des LLM similaires et environ 14,7 fois inférieur à celui des modèles frontière.
Limites et points d'attention. Les résultats sont moins convaincants en agentique sur PinchBench, où Kimi K2.5 se situe vers le bas du classement. SimpleQA Verified révèle également une fiabilité factuelle limitée, tandis que FrontierMath montre une marge importante sur les mathématiques de recherche les plus difficiles. Les classements Arena restent contrastés, notamment en image-to-code et en code, malgré de meilleurs résultats sur les bugs logiciels structurés. Kimi K2.5 convient ainsi surtout aux usages recherchant un modèle multimodal à poids ouverts, économique, doté d’un long contexte et performant en raisonnement scientifique ou en correction de code.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com).