Kimi K3
Kimi K3 est un LLM agentique multimodal lancé le 16 juillet 2026 par le chinois Moonshot AI. Ses poids sont ouverts et l’usage commercial est autorisé sous Kimi K3 License. Son architecture Mixture-of-Experts compte 2 800 milliards de paramètres, dont 104 milliards activés, avec 16…
Kimi K3 est un LLM agentique multimodal lancé le 16 juillet 2026 par le chinois Moonshot AI. Ses poids sont ouverts et l’usage commercial est autorisé sous Kimi K3 License. Son architecture Mixture-of-Experts compte 2 800 milliards de paramètres, dont 104 milliards activés, avec 16 experts sélectionnés parmi 896.
Sa fenêtre de contexte atteint 1 048 576 tokens. Le modèle traite nativement le texte et les images, tandis que la vidéo figure aussi parmi ses modalités annoncées. Son entraînement représente 2,0 × 10²⁵ FLOP, soit environ 2 600 GPU H100 mobilisés pendant trois mois.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Moonshot AI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Kimi K3 License |
| Date de sortie | 16 juillet 2026 |
| Multimodal | oui |
| Paramètres | 2800 milliards |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 252 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 251 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 98,0 % | 68ᵉ / 233 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 98,0 % | 26ᵉ / 246 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 97,2 % | 13ᵉ / 122 | epoch | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 97,0 % | 168ᵉ / 259 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 96,0 % | 13ᵉ / 253 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 93,9 % | 76ᵉ / 226 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 93,1 % | 11ᵉ / 143 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 82,0 % | 46ᵉ / 256 | benchable | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 72,2 % | 13ᵉ / 42 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 42,7 % | 30ᵉ / 63 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 39,0 % | 14ᵉ / 43 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 39,0 % | 14ᵉ / 65 | epoch | ✅ Mesuré |
| Epoch: Mystery Game Puzzles | 26,0 % | 15ᵉ / 21 | epoch | ✅ Mesuré |
| MathVision | 97,8 % | 1ᵉ / 32 | llm-stats | Auto-déclaré |
| DeepSearchQA | 95,0 % | 1ᵉ / 8 | llm-stats | Auto-déclaré |
| GPQA | 93,5 % | 7ᵉ / 221 | llm-stats | Auto-déclaré |
| CharXiv-R | 91,3 % | 2ᵉ / 47 | llm-stats | Auto-déclaré |
| BrowseComp | 91,2 % | 1ᵉ / 58 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.1 | 88,3 % | 2ᵉ / 17 | llm-stats | Auto-déclaré |
| BabyVision | 85,7 % | 1ᵉ / 9 | llm-stats | Auto-déclaré |
| MCP Atlas | 84,2 % | 2ᵉ / 30 | llm-stats | Auto-déclaré |
| MMMU-Pro (with tools) | 83,4 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| MMMU-Pro | 81,6 % | 7ᵉ / 65 | llm-stats | Auto-déclaré |
| FrontierSWE | 81,2 % | 2ᵉ / 15 | llm-stats | Auto-déclaré |
| Program Bench | 77,8 % | 1ᵉ / 5 | llm-stats | Auto-déclaré |
| Toolathlon | 73,2 % | 2ᵉ / 31 | llm-stats | Auto-déclaré |
| DeepSWE 1.1 | 69,0 % | 4ᵉ / 19 | llm-stats | n.d. |
| DeepSWE | 67,5 % | 3ᵉ / 10 | llm-stats | Auto-déclaré |
| OfficeQA Pro | 63,3 % | 4ᵉ / 7 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 56,0 % | 9ᵉ / 91 | llm-stats | Auto-déclaré |
| WorldVQA | 51,0 % | 3ᵉ / 5 | llm-stats | Auto-déclaré |
| MLS-Bench Lite | 48,3 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| SWE-Marathon | 42,0 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| ZEROBench | 41,0 % | 1ᵉ / 9 | llm-stats | Auto-déclaré |
| APEX-Agents | 37,6 % | 1ᵉ / 7 | llm-stats | Auto-déclaré |
| PostTrainBench | 36,6 % | 2ᵉ / 5 | llm-stats | Auto-déclaré |
| AutomationBench | 30,8 % | 1ᵉ / 8 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : General Knowledge (Baseline)
Benchable : Ethics (Baseline)
Classements Arena (Elo)
Arena Code · 109 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1676 |
| 2ᵉ | Claude Opus 5 | 1669 |
| 3ᵉ | Qwen3.8 Max | 1668 |
Arena Image-to-Code · 42 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Opus 5 | 1670 |
| 2ᵉ | Qwen3.8 Max | 1631 |
| 3ᵉ | Claude Fable 5 | 1626 |
| ⋯ | ⋯ | |
| 5ᵉ | Grok 4.5 (high) | 1580 |
| 6ᵉ | Claude Opus 4.7 | 1579 |
| 7ᵉ | Kimi K3 | 1570 |
| 8ᵉ | Claude Opus 4.7 | 1565 |
| 9ᵉ | Muse Spark 1.1 | 1544 |
Arena Text · 199 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1509 |
| 2ᵉ | Claude Opus 4.6 | 1505 |
| 3ᵉ | Claude Opus 4.7 | 1502 |
| ⋯ | ⋯ | |
| 10ᵉ | Gemini 3 Pro | 1486 |
| 11ᵉ | Gemini 3.1 Pro Preview | 1485 |
| 12ᵉ | Kimi K3 | 1485 |
| 13ᵉ | Claude Opus 4.8 | 1484 |
| 14ᵉ | GPT-5.6 Sol | 1483 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Morph | 2,9 $ | 14 $ | 0,29 $ |
| fireworks | 3 $ | 15 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 43 % au-dessus de la moyenne des LLM similaires, et 1,9 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 1,1 $ |
| Latence moyenne par benchmark — Benchable | 44 min 23 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 2,0 × 10²⁵ FLOP |
| Pays | China |
Notre analyse
Forces. À sa sortie, Kimi K3 figurait dans le top 12% des LLM de sa génération sur GPQA diamond. Il obtient aussi un résultat élevé sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée. Il occupe la deuxième place de l’Arena code, dans le groupe de tête avec Claude Opus 5, Qwen3.8 Max et Claude Fable 5. Dans l’Arena text, il se classe derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7, avec un faible écart par rapport au premier. Sa longue fenêtre de contexte et l’orchestration d’outils de terminal soutiennent les travaux de codage prolongés.
Limites et points d'attention. En image-to-code, Kimi K3 se place derrière Claude Opus 5, Qwen3.8 Max et Claude Fable 5. Le premier est nettement devant. Les benchmarks Benchable de General Knowledge, Ethics, Hallucinations et Reasoning sont plafonnés et départagent peu les modèles. Le tarif reste dans la moyenne, mais dépasse de 43% celle des LLM similaires. Il demeure environ 1,9 fois moins cher que les modèles frontière. Kimi K3 convient surtout au code, au raisonnement, à la recherche et aux productions multimodales sur de longs contextes.
Sources des données : OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).