LongCat-Flash-Chat
Publié par Meituan en août 2025, LongCat-Flash-Chat est un LLM conversationnel non-thinking à poids ouverts, sous licence MIT avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 560 milliards de paramètres, mais n’en active dynamiquement qu’environ 18,6 à 31,3…
Publié par Meituan en août 2025, LongCat-Flash-Chat est un LLM conversationnel non-thinking à poids ouverts, sous licence MIT avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 560 milliards de paramètres, mais n’en active dynamiquement qu’environ 18,6 à 31,3 milliards selon le contexte.
Le modèle se distingue par une fenêtre de 131 072 tokens, le dialogue multi-tours et les appels d’outils. Son entraînement multi-étapes cible le raisonnement, le code et les capacités agentiques. Des adaptations sont prévues pour le déploiement avec SGLang et vLLM.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meituan |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 29 août 2025 |
| Multimodal | non |
| Paramètres | 560 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MATH-500 | 96,4 % | 12ᵉ / 31 | llm-stats | Auto-déclaré |
| MMLU | 89,7 % | 11ᵉ / 98 | llm-stats | Auto-déclaré |
| IFEval | 89,6 % | 20ᵉ / 65 | llm-stats | Auto-déclaré |
| ZebraLogic | 89,3 % | 4ᵉ / 7 | llm-stats | Auto-déclaré |
| HumanEval | 88,4 % | 18ᵉ / 65 | llm-stats | Auto-déclaré |
| CMMLU | 84,3 % | 3ᵉ / 6 | llm-stats | Auto-déclaré |
| MMLU-Pro | 82,7 % | 32ᵉ / 125 | llm-stats | Auto-déclaré |
| DROP | 79,1 % | 15ᵉ / 29 | llm-stats | Auto-déclaré |
| Tau2 Telecom | 73,7 % | 23ᵉ / 34 | llm-stats | Auto-déclaré |
| GPQA | 73,2 % | 106ᵉ / 219 | llm-stats | Auto-déclaré |
| Tau2 Retail | 71,3 % | 18ᵉ / 25 | llm-stats | Auto-déclaré |
| AIME 2025 | 61,3 % | 91ᵉ / 108 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 60,4 % | 76ᵉ / 102 | llm-stats | Auto-déclaré |
| Tau2 Airline | 58,0 % | 12ᵉ / 22 | llm-stats | Auto-déclaré |
| LiveCodeBench | 48,0 % | 47ᵉ / 72 | llm-stats | Auto-déclaré |
| Terminal-Bench | 39,5 % | 9ᵉ / 25 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 125ᵉ | o1 | 1402 |
| 126ᵉ | Qwen3-Next-80B-A3B-Instruct | 1401 |
| 127ᵉ | LongCat-Flash-Chat | 1401 |
| 128ᵉ | Claude Sonnet 4 | 1399 |
| 129ᵉ | Qwen3-235B-A22B-Thinking-2507 | 1399 |
Notre analyse
Forces. À sa sortie, LongCat-Flash-Chat se classait dans le top 31% des LLM de sa génération sur GPQA, un résultat solide pour les questions scientifiques complexes. Sa longue fenêtre de contexte convient au traitement de conversations et de contenus volumineux. Les appels d’outils, le format multi-tours et l’entraînement orienté vers les tâches agentiques élargissent son champ d’usage. Son architecture combine des experts à zéro calcul, un contrôle PID du biais des experts et des connexions Shortcut-connected MoE afin d’améliorer l’efficacité de l’entraînement et de l’inférence.
Limites et points d'attention. Dans Arena text, le modèle se situe dans la partie basse du classement, nettement derrière le modèle en tête. Ce résultat indique une qualité conversationnelle comparative moins convaincante que celle des systèmes haut de gamme évalués dans cette arène. Son mode non-thinking le distingue aussi des modèles conçus pour expliciter une phase de raisonnement avant la réponse. Enfin, ses 560 milliards de paramètres totaux impliquent une architecture de très grande taille, même si seule une fraction est activée selon le contexte. LongCat-Flash-Chat cible surtout les déploiements open-weights nécessitant un long contexte, des échanges multi-tours et l’intégration d’outils.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai).