LongCat-Flash-Thinking

Publié par Meituan le 22 septembre 2025, LongCat-Flash-Thinking est un LLM de raisonnement open weights sous licence MIT, utilisable commercialement. À sa sortie, ses résultats sur GPQA le plaçaient dans le haut du panier des modèles de sa génération.

Publié par Meituan le 22 septembre 2025, LongCat-Flash-Thinking est un LLM de raisonnement open weights sous licence MIT, utilisable commercialement. À sa sortie, ses résultats sur GPQA le plaçaient dans le haut du panier des modèles de sa génération.

Ses 560 milliards de paramètres reposent sur une architecture Mixture-of-Experts qui en active dynamiquement 18,6 à 31,3 milliards selon le contexte. Son entraînement combine un démarrage Long CoT, un apprentissage par renforcement à grande échelle, le système DORA et une méthode parallèle spécialisée par domaines.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeituan
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie22 septembre 2025
Multimodalnon
Paramètres560 milliards
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MATH-50099,2 %1ᵉ / 31llm-statsAuto-déclaré
ZebraLogic95,5 %2ᵉ / 7llm-statsAuto-déclaré
AIME 202493,3 %3ᵉ / 52llm-statsAuto-déclaré
AIME 202590,6 %42ᵉ / 108llm-statsAuto-déclaré
MMLU-Redux89,3 %26ᵉ / 48llm-statsAuto-déclaré
Tau2 Telecom83,1 %19ᵉ / 34llm-statsAuto-déclaré
MMLU-Pro82,6 %33ᵉ / 125llm-statsAuto-déclaré
GPQA81,5 %69ᵉ / 219llm-statsAuto-déclaré
LiveCodeBench79,4 %10ᵉ / 72llm-statsAuto-déclaré
BFCL-v374,4 %3ᵉ / 19llm-statsAuto-déclaré
Tau2 Retail71,5 %16ᵉ / 25llm-statsAuto-déclaré
Tau2 Airline67,5 %3ᵉ / 22llm-statsAuto-déclaré
SWE-Bench Verified59,4 %78ᵉ / 102llm-statsAuto-déclaré
ARC-AGI50,3 %6ᵉ / 7llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. LongCat-Flash-Thinking se distingue d'abord en raisonnement général : à sa sortie, il figurait dans le top 12% des 130 LLM de sa génération sur GPQA, un benchmark centré sur des questions scientifiques difficiles. Son champ fonctionnel couvre aussi le raisonnement formel et agentique, notamment les mathématiques, la logique, la programmation, la preuve automatique de théorèmes et l'utilisation d'outils. La fenêtre de contexte de 128 000 tokens convient au traitement de séquences longues. Les formats prévus pour le chat mono-tour, multi-tour et les appels d'outils facilitent plusieurs modes d'intégration. La licence MIT autorise en outre les usages commerciaux.

Limites et points d'attention. Malgré l'activation sélective propre à son architecture Mixture-of-Experts, le modèle totalise 560 milliards de paramètres, tandis que 18,6 à 31,3 milliards sont mobilisés selon le contexte. Cette variation rend la charge de calcul dépendante des requêtes. L'évaluation comparative disponible repose sur GPQA et sur une seule source de données concordante, ce qui situe solidement son raisonnement scientifique à son époque sans étendre cette conclusion à tous ses domaines déclarés. LongCat-Flash-Thinking cible ainsi les projets de raisonnement avancé, de programmation, de preuve formelle et d'agents utilisant des outils.


Sources des données : LLM-Stats (llm-stats.com).