Kimi K2.5

Développé en Chine par Moonshot AI et sorti le 27 janvier 2026, Kimi K2.5 est un LLM multimodal et agentique à poids ouverts sous licence MIT, avec usage commercial autorisé. Son architecture Mixture-of-Experts compte 1000 milliards de paramètres, dont 32 milliards actifs, et accepte un…

Développé en Chine par Moonshot AI et sorti le 27 janvier 2026, Kimi K2.5 est un LLM multimodal et agentique à poids ouverts sous licence MIT, avec usage commercial autorisé. Son architecture Mixture-of-Experts compte 1000 milliards de paramètres, dont 32 milliards actifs, et accepte un contexte de 262 144 tokens.

Le modèle traite conjointement texte et images, propose des modes instant et thinking, utilise des outils à partir d’entrées visuelles et génère du code depuis des spécifications visuelles. Son entraînement représente 5,8 × 10²⁴ FLOP, soit environ 1,6 million d’heures-GPU H100, l’équivalent de 750 GPU H100 mobilisés pendant trois mois.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMoonshot AI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie27 janvier 2026
Multimodaloui
Paramètres1000 milliards
Paramètres actifs32 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text,image,video → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index38.128ᵉ / 137

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202596,1 %17ᵉ / 108llm-statsAuto-déclaré
HMMT 202595,4 %6ᵉ / 33llm-statsAuto-déclaré
InfoVQAtest92,6 %1ᵉ / 12llm-statsAuto-déclaré
OCRBench92,3 %1ᵉ / 22llm-statsAuto-déclaré
MathVista-Mini90,1 %1ᵉ / 23llm-statsAuto-déclaré
OmniDocBench 1.588,8 %9ᵉ / 13llm-statsAuto-déclaré
GPQA87,6 %33ᵉ / 219llm-statsAuto-déclaré
Video-MME87,4 %5ᵉ / 17llm-statsAuto-déclaré
MMLU-Pro87,1 %7ᵉ / 125llm-statsAuto-déclaré
VideoMMMU86,6 %3ᵉ / 26llm-statsAuto-déclaré
LiveCodeBench v685,0 %9ᵉ / 53llm-statsAuto-déclaré
MathVision84,2 %10ᵉ / 32llm-statsAuto-déclaré
IMO-AnswerBench81,8 %13ᵉ / 19llm-statsAuto-déclaré
MMVU80,4 %1ᵉ / 4llm-statsAuto-déclaré
LongVideoBench79,8 %3ᵉ / 4llm-statsAuto-déclaré
WideSearch79,0 %2ᵉ / 9llm-statsAuto-déclaré
MMMU-Pro78,5 %17ᵉ / 64llm-statsAuto-déclaré
CharXiv-R77,5 %24ᵉ / 45llm-statsAuto-déclaré
DeepSearchQA77,1 %7ᵉ / 8llm-statsAuto-déclaré
SWE-Bench Verified76,8 %27ᵉ / 102llm-statsAuto-déclaré
LVBench75,9 %4ᵉ / 23llm-statsAuto-déclaré
BrowseComp74,9 %25ᵉ / 57llm-statsAuto-déclaré
SWE-bench Multilingual73,0 %13ᵉ / 34llm-statsAuto-déclaré
SimpleVQA71,2 %5ᵉ / 13llm-statsAuto-déclaré
MotionBench70,4 %3ᵉ / 3llm-statsAuto-déclaré
AA-LCR70,0 %3ᵉ / 15llm-statsAuto-déclaré
LiveBench69,1 %32ᵉ / 38llm-statsn.d.
LongBench v261,0 %4ᵉ / 15llm-statsAuto-déclaré
Seal-057,4 %1ᵉ / 6llm-statsAuto-déclaré
Terminal-Bench 2.050,8 %35ᵉ / 49llm-statsAuto-déclaré
SWE-Bench Pro50,7 %39ᵉ / 41llm-statsAuto-déclaré
Humanity's Last Exam50,2 %19ᵉ / 89llm-statsAuto-déclaré
SciCode48,7 %7ᵉ / 18llm-statsAuto-déclaré
WorldVQA46,3 %5ᵉ / 5llm-statsAuto-déclaré
CyberGym41,3 %9ᵉ / 9llm-statsAuto-déclaré
FrontierSWE26,0 %13ᵉ / 14llm-statsn.d.
ZEROBench11,0 %5ᵉ / 9llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Grok Build 0.1 061639.8
▶ Kimi K2.538.1
Nemotron 3 Ultra 550B A…37.8

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text145052ᵉ / 200Claude Fable 5 (1507)
Arena Image-to-Code143921ᵉ / 31Claude Fable 5 (1627)
Arena Code143340ᵉ / 99Kimi K3 (1679)
Arena Document143122ᵉ / 32Claude Opus 4.6 (1508)
Arena Vision124633ᵉ / 135Claude Fable 5 (1318)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DigitalOcean0,375 $2,025 $0,203 $

Prix en dollars US par million de tokens.

Sa tarification se situe 82 % en dessous de la moyenne des LLM similaires, et 14,7 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)7,15 $
Durée d'exécution — PinchBench6 h 02 min
Indice valeur/coût — PinchBench29,62

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement5,8 × 10²⁴ FLOP
MatérielNVIDIA H800 SXM5
PaysChina

Notre analyse

Forces. Kimi K2.5 excelle surtout en raisonnement mathématique de niveau lycée sur OTIS Mock AIME et en questions scientifiques de niveau doctorat sur GPQA diamond. À sa sortie, il figurait dans le top 9% des LLM de sa génération sur ce dernier test. SWE-Bench verified confirme aussi de solides aptitudes à résoudre de vrais bugs GitHub. Son architecture associe l’attention MLA, l’activation SwiGLU et l’encodeur visuel MoonViT. Elle prend en charge la compréhension vision-langage, les échanges conversationnels, l’usage d’outils et la décomposition de tâches complexes entre plusieurs agents parallèles. Son tarif est très économique, 81% sous la moyenne des LLM similaires et environ 14,7 fois inférieur à celui des modèles frontière.

Limites et points d'attention. Les résultats sont moins convaincants en agentique sur PinchBench, où Kimi K2.5 se situe vers le bas du classement. SimpleQA Verified révèle également une fiabilité factuelle limitée, tandis que FrontierMath montre une marge importante sur les mathématiques de recherche les plus difficiles. Les classements Arena restent contrastés, notamment en image-to-code et en code, malgré de meilleurs résultats sur les bugs logiciels structurés. Kimi K2.5 convient ainsi surtout aux usages recherchant un modèle multimodal à poids ouverts, économique, doté d’un long contexte et performant en raisonnement scientifique ou en correction de code.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com).