Kimi K2 0905
Kimi K2 0905 est un LLM propriétaire de Moonshot AI, lancé le 5 septembre 2025. Son architecture Mixture-of-Experts réunit 1000 milliards de paramètres, dont 32 milliards activés, avec une fenêtre de contexte de 262 144 tokens et des connaissances arrêtées au 31 décembre 2024.
Kimi K2 0905 est un LLM propriétaire de Moonshot AI, lancé le 5 septembre 2025. Son architecture Mixture-of-Experts réunit 1000 milliards de paramètres, dont 32 milliards activés, avec une fenêtre de contexte de 262 144 tokens et des connaissances arrêtées au 31 décembre 2024.
Le modèle cible notamment le codage agentique, le développement frontend et les tâches à long horizon. Il prend en charge le chat et l’appel d’outils via des API compatibles OpenAI et Anthropic. Son principal argument commercial reste son tarif très économique, inférieur de 70% à la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Moonshot AI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 5 septembre 2025 |
| Multimodal | non |
| Paramètres | 1000 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 100,0 % | 1ᵉ / 108 | llm-stats | Auto-déclaré |
| HMMT 2025 | 97,5 % | 4ᵉ / 33 | llm-stats | Auto-déclaré |
| HumanEval | 94,5 % | 2ᵉ / 65 | llm-stats | Auto-déclaré |
| MMLU-Redux | 94,4 % | 5ᵉ / 48 | llm-stats | Auto-déclaré |
| MMLU | 90,2 % | 8ᵉ / 98 | llm-stats | Auto-déclaré |
| MATH | 89,1 % | 6ᵉ / 70 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 83,1 % | 13ᵉ / 53 | llm-stats | Auto-déclaré |
| MMLU-Pro | 82,5 % | 35ᵉ / 125 | llm-stats | Auto-déclaré |
| IMO-AnswerBench | 78,6 % | 17ᵉ / 19 | llm-stats | Auto-déclaré |
| GPQA | 75,8 % | 93ᵉ / 219 | llm-stats | Auto-déclaré |
| WritingBench | 73,8 % | 15ᵉ / 15 | llm-stats | Auto-déclaré |
| AIME 2024 | 72,0 % | 38ᵉ / 52 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 71,3 % | 53ᵉ / 102 | llm-stats | Auto-déclaré |
| BrowseComp-zh | 62,3 % | 8ᵉ / 13 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 61,1 % | 25ᵉ / 34 | llm-stats | Auto-déclaré |
| BrowseComp | 60,2 % | 35ᵉ / 57 | llm-stats | Auto-déclaré |
| HealthBench | 58,0 % | 1ᵉ / 8 | llm-stats | Auto-déclaré |
| Seal-0 | 56,3 % | 2ᵉ / 6 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 51,0 % | 17ᵉ / 89 | llm-stats | Auto-déclaré |
| OJBench | 48,7 % | 2ᵉ / 9 | llm-stats | Auto-déclaré |
| Terminal-Bench | 47,1 % | 3ᵉ / 25 | llm-stats | Auto-déclaré |
| SciCode | 44,8 % | 8ᵉ / 18 | llm-stats | Auto-déclaré |
| Multi-SWE-Bench | 41,9 % | 4ᵉ / 6 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 82ᵉ | o3 | 1431 |
| 83ᵉ | MiMo-V2-Omni | 1430 |
| 84ᵉ | Kimi K2 0905 | 1430 |
| 85ᵉ | Mistral Medium 3.5 | 1427 |
| 86ᵉ | amazon-nova-experimental-chat-26-02-10 | 1427 |
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 82ᵉ | o3 | 1431 |
| 83ᵉ | MiMo-V2-Omni | 1430 |
| 84ᵉ | Kimi K2 0905 | 1430 |
| 85ᵉ | Mistral Medium 3.5 | 1427 |
| 86ᵉ | amazon-nova-experimental-chat-26-02-10 | 1427 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 74ᵉ | DeepSeek-V3.2 | 1332 |
| 75ᵉ | GPT-5.1 Codex | 1330 |
| 76ᵉ | Kimi K2 0905 | 1330 |
| 77ᵉ | Claude Haiku 4.5 | 1327 |
| 78ᵉ | MiniMax M2 | 1305 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| NovitaAI | 0,6 $ | 2,5 $ | 0,15 $ |
| NovitaAI | 0,6 $ | 2,5 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 71 % en dessous de la moyenne des LLM similaires, et 9,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,05 $ |
| Latence moyenne par benchmark — Benchable | 19 min 17 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Kimi K2 0905 se classe premier sur Hallucinations dans le protocole Baseline de Benchable et obtient également un résultat très élevé en Email Classification. À sa sortie, il figurait dans le top 24% des LLM de sa génération sur GPQA, ce qui le situait dans le haut du panier pour cette évaluation. Son grand contexte favorise le traitement de longs contenus, tandis que son architecture Mixture-of-Experts limite l’activation à 32 milliards de paramètres sur un total de 1000 milliards. Le coût constitue un autre avantage net : il est environ 9,2 fois inférieur à celui des modèles frontière.
Limites et points d'attention. Les résultats sont moins convaincants en Ethics et en General Knowledge, où le modèle apparaît en bas de classement. Reasoning et Coding restent plus proches du milieu de tableau malgré des scores absolus élevés. Les classements Arena confirment ce positionnement : Kimi K2 0905 occupe la seconde moitié du tableau en texte et reste loin de la tête en Arena Code. Ses connaissances s’arrêtent fin 2024 et ses poids ne sont pas ouverts. Le modèle convient surtout aux usages sensibles au coût, aux longs contextes, au chat avec outils et aux travaux de codage ne nécessitant pas les meilleures performances disponibles.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).