LongCat-Flash-Chat

Publié par Meituan en août 2025, LongCat-Flash-Chat est un LLM conversationnel non-thinking à poids ouverts, sous licence MIT avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 560 milliards de paramètres, mais n’en active dynamiquement qu’environ 18,6 à 31,3…

Publié par Meituan en août 2025, LongCat-Flash-Chat est un LLM conversationnel non-thinking à poids ouverts, sous licence MIT avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 560 milliards de paramètres, mais n’en active dynamiquement qu’environ 18,6 à 31,3 milliards selon le contexte.

Le modèle se distingue par une fenêtre de 131 072 tokens, le dialogue multi-tours et les appels d’outils. Son entraînement multi-étapes cible le raisonnement, le code et les capacités agentiques. Des adaptations sont prévues pour le déploiement avec SGLang et vLLM.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeituan
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie29 août 2025
Multimodalnon
Paramètres560 milliards
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MATH-50096,4 %12ᵉ / 31llm-statsAuto-déclaré
MMLU89,7 %11ᵉ / 98llm-statsAuto-déclaré
IFEval89,6 %20ᵉ / 65llm-statsAuto-déclaré
ZebraLogic89,3 %4ᵉ / 7llm-statsAuto-déclaré
HumanEval88,4 %18ᵉ / 65llm-statsAuto-déclaré
CMMLU84,3 %3ᵉ / 6llm-statsAuto-déclaré
MMLU-Pro82,7 %32ᵉ / 125llm-statsAuto-déclaré
DROP79,1 %15ᵉ / 29llm-statsAuto-déclaré
Tau2 Telecom73,7 %23ᵉ / 34llm-statsAuto-déclaré
GPQA73,2 %106ᵉ / 219llm-statsAuto-déclaré
Tau2 Retail71,3 %18ᵉ / 25llm-statsAuto-déclaré
AIME 202561,3 %91ᵉ / 108llm-statsAuto-déclaré
SWE-Bench Verified60,4 %76ᵉ / 102llm-statsAuto-déclaré
Tau2 Airline58,0 %12ᵉ / 22llm-statsAuto-déclaré
LiveCodeBench48,0 %47ᵉ / 72llm-statsAuto-déclaré
Terminal-Bench39,5 %9ᵉ / 25llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
125ᵉo11402
126ᵉQwen3-Next-80B-A3B-Instruct1401
127ᵉLongCat-Flash-Chat1401
128ᵉClaude Sonnet 41399
129ᵉQwen3-235B-A22B-Thinking-25071399

Notre analyse

Forces. À sa sortie, LongCat-Flash-Chat se classait dans le top 31% des LLM de sa génération sur GPQA, un résultat solide pour les questions scientifiques complexes. Sa longue fenêtre de contexte convient au traitement de conversations et de contenus volumineux. Les appels d’outils, le format multi-tours et l’entraînement orienté vers les tâches agentiques élargissent son champ d’usage. Son architecture combine des experts à zéro calcul, un contrôle PID du biais des experts et des connexions Shortcut-connected MoE afin d’améliorer l’efficacité de l’entraînement et de l’inférence.

Limites et points d'attention. Dans Arena text, le modèle se situe dans la partie basse du classement, nettement derrière le modèle en tête. Ce résultat indique une qualité conversationnelle comparative moins convaincante que celle des systèmes haut de gamme évalués dans cette arène. Son mode non-thinking le distingue aussi des modèles conçus pour expliciter une phase de raisonnement avant la réponse. Enfin, ses 560 milliards de paramètres totaux impliquent une architecture de très grande taille, même si seule une fraction est activée selon le contexte. LongCat-Flash-Chat cible surtout les déploiements open-weights nécessitant un long contexte, des échanges multi-tours et l’intégration d’outils.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai).