Kimi K3

Kimi K3 est un LLM agentique multimodal lancé le 16 juillet 2026 par le chinois Moonshot AI. Ses poids sont ouverts et l’usage commercial est autorisé sous Kimi K3 License. Son architecture Mixture-of-Experts compte 2 800 milliards de paramètres, dont 104 milliards activés, avec 16…

Kimi K3 est un LLM agentique multimodal lancé le 16 juillet 2026 par le chinois Moonshot AI. Ses poids sont ouverts et l’usage commercial est autorisé sous Kimi K3 License. Son architecture Mixture-of-Experts compte 2 800 milliards de paramètres, dont 104 milliards activés, avec 16 experts sélectionnés parmi 896.

Sa fenêtre de contexte atteint 1 048 576 tokens. Le modèle traite nativement le texte et les images, tandis que la vidéo figure aussi parmi ses modalités annoncées. Son entraînement représente 2,0 × 10²⁵ FLOP, soit environ 2 600 GPU H100 mobilisés pendant trois mois.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMoonshot AI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceKimi K3 License
Date de sortie16 juillet 2026
Multimodaloui
Paramètres2800 milliards
Fenêtre de contexte1 048 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 252benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 251benchable✅ Mesuré
Benchable : Hallucinations (Baseline)98,0 %68ᵉ / 233benchable✅ Mesuré
Benchable : Reasoning (Baseline)98,0 %26ᵉ / 246benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-202597,2 %13ᵉ / 122epoch✅ Mesuré
Benchable : Email Classification (Baseline)97,0 %168ᵉ / 259benchable✅ Mesuré
Benchable : Coding (Baseline)96,0 %13ᵉ / 253benchable✅ Mesuré
Benchable : Mathematics (Baseline)93,9 %76ᵉ / 226benchable✅ Mesuré
Epoch: GPQA diamond93,1 %11ᵉ / 143epoch✅ Mesuré
Benchable : Instruction Following (Baseline)82,0 %46ᵉ / 256benchable✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private72,2 %13ᵉ / 42epoch✅ Mesuré
Epoch: SimpleQA Verified42,7 %30ᵉ / 63epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private39,0 %14ᵉ / 43epoch✅ Mesuré
Epoch: Chess Puzzles39,0 %14ᵉ / 65epoch✅ Mesuré
Epoch: Mystery Game Puzzles26,0 %15ᵉ / 21epoch✅ Mesuré
MathVision97,8 %1ᵉ / 32llm-statsAuto-déclaré
DeepSearchQA95,0 %1ᵉ / 8llm-statsAuto-déclaré
GPQA93,5 %7ᵉ / 221llm-statsAuto-déclaré
CharXiv-R91,3 %2ᵉ / 47llm-statsAuto-déclaré
BrowseComp91,2 %1ᵉ / 58llm-statsAuto-déclaré
Terminal-Bench 2.188,3 %2ᵉ / 17llm-statsAuto-déclaré
BabyVision85,7 %1ᵉ / 9llm-statsAuto-déclaré
MCP Atlas84,2 %2ᵉ / 30llm-statsAuto-déclaré
MMMU-Pro (with tools)83,4 %2ᵉ / 4llm-statsAuto-déclaré
MMMU-Pro81,6 %7ᵉ / 65llm-statsAuto-déclaré
FrontierSWE81,2 %2ᵉ / 15llm-statsAuto-déclaré
Program Bench77,8 %1ᵉ / 5llm-statsAuto-déclaré
Toolathlon73,2 %2ᵉ / 31llm-statsAuto-déclaré
DeepSWE 1.169,0 %4ᵉ / 19llm-statsn.d.
DeepSWE67,5 %3ᵉ / 10llm-statsAuto-déclaré
OfficeQA Pro63,3 %4ᵉ / 7llm-statsAuto-déclaré
Humanity's Last Exam56,0 %9ᵉ / 91llm-statsAuto-déclaré
WorldVQA51,0 %3ᵉ / 5llm-statsAuto-déclaré
MLS-Bench Lite48,3 %1ᵉ / 3llm-statsAuto-déclaré
SWE-Marathon42,0 %1ᵉ / 3llm-statsAuto-déclaré
ZEROBench41,0 %1ᵉ / 9llm-statsAuto-déclaré
APEX-Agents37,6 %1ᵉ / 7llm-statsAuto-déclaré
PostTrainBench36,6 %2ᵉ / 5llm-statsAuto-déclaré
AutomationBench30,8 %1ᵉ / 8llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : General Knowledge (Baseline)

▶ Kimi K3100 %

Benchable : Ethics (Baseline)

▶ Kimi K3100 %
command-r-plus-08-202499 %

Classements Arena (Elo)

Arena Code · 109 modèles classés

RangModèleElo
1ᵉKimi K31676
2ᵉClaude Opus 51669
3ᵉQwen3.8 Max1668

Arena Image-to-Code · 42 modèles classés

RangModèleElo
1ᵉClaude Opus 51670
2ᵉQwen3.8 Max1631
3ᵉClaude Fable 51626
5ᵉGrok 4.5 (high)1580
6ᵉClaude Opus 4.71579
7ᵉKimi K31570
8ᵉClaude Opus 4.71565
9ᵉMuse Spark 1.11544

Arena Text · 199 modèles classés

RangModèleElo
1ᵉClaude Fable 51509
2ᵉClaude Opus 4.61505
3ᵉClaude Opus 4.71502
10ᵉGemini 3 Pro1486
11ᵉGemini 3.1 Pro Preview1485
12ᵉKimi K31485
13ᵉClaude Opus 4.81484
14ᵉGPT-5.6 Sol1483

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Morph2,9 $14 $0,29 $
fireworks3 $15 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 43 % au-dessus de la moyenne des LLM similaires, et 1,9 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable1,1 $
Latence moyenne par benchmark — Benchable44 min 23 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement2,0 × 10²⁵ FLOP
PaysChina

Notre analyse

Forces. À sa sortie, Kimi K3 figurait dans le top 12% des LLM de sa génération sur GPQA diamond. Il obtient aussi un résultat élevé sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée. Il occupe la deuxième place de l’Arena code, dans le groupe de tête avec Claude Opus 5, Qwen3.8 Max et Claude Fable 5. Dans l’Arena text, il se classe derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7, avec un faible écart par rapport au premier. Sa longue fenêtre de contexte et l’orchestration d’outils de terminal soutiennent les travaux de codage prolongés.

Limites et points d'attention. En image-to-code, Kimi K3 se place derrière Claude Opus 5, Qwen3.8 Max et Claude Fable 5. Le premier est nettement devant. Les benchmarks Benchable de General Knowledge, Ethics, Hallucinations et Reasoning sont plafonnés et départagent peu les modèles. Le tarif reste dans la moyenne, mais dépasse de 43% celle des LLM similaires. Il demeure environ 1,9 fois moins cher que les modèles frontière. Kimi K3 convient surtout au code, au raisonnement, à la recherche et aux productions multimodales sur de longs contextes.


Sources des données : OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).