LongCat-Flash-Thinking-2601

Publié par Meituan le 14 janvier 2026, LongCat-Flash-Thinking-2601 est un modèle de raisonnement à poids ouverts sous licence MIT, utilisable commercialement. Son architecture Mixture-of-Experts réunit 560 milliards de paramètres au total, dont 27 milliards sont activés lors du traitement.

Publié par Meituan le 14 janvier 2026, LongCat-Flash-Thinking-2601 est un modèle de raisonnement à poids ouverts sous licence MIT, utilisable commercialement. Son architecture Mixture-of-Experts réunit 560 milliards de paramètres au total, dont 27 milliards sont activés lors du traitement.

Le modèle se distingue par son orientation agentique : usage d’outils, recherche autonome et raisonnement intégré aux outils. Son Heavy Thinking Mode combine plusieurs trajectoires de pensée parallèles avant une synthèse. Sa fenêtre de contexte atteint 128 000 tokens, tandis que son format de conversation gère la déclaration d’outils, la pensée intercalée et la conservation optionnelle du raisonnement entre les tours.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeituan
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie14 janvier 2026
Multimodalnon
Paramètres560 milliards
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202599,6 %8ᵉ / 108llm-statsAuto-déclaré
Tau2 Telecom99,3 %1ᵉ / 34llm-statsAuto-déclaré
Tau2 Retail88,6 %4ᵉ / 25llm-statsAuto-déclaré
LiveCodeBench82,8 %6ᵉ / 72llm-statsAuto-déclaré
GPQA80,5 %77ᵉ / 219llm-statsAuto-déclaré
IMO-AnswerBench78,6 %17ᵉ / 19llm-statsAuto-déclaré
Tau2 Airline76,5 %1ᵉ / 22llm-statsAuto-déclaré
SWE-Bench Verified70,0 %57ᵉ / 102llm-statsAuto-déclaré
BrowseComp-zh69,0 %4ᵉ / 13llm-statsAuto-déclaré
BrowseComp56,6 %37ᵉ / 57llm-statsAuto-déclaré
Humanity's Last Exam25,2 %46ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. À sa sortie, LongCat-Flash-Thinking-2601 se classait dans le quart supérieur des LLM de sa génération sur GPQA, un benchmark consacré aux questions scientifiques complexes. Ce résultat le situait favorablement parmi les 158 modèles publiés au cours des quelque 18 mois précédents. Son entraînement cible directement les scénarios agentiques, avec une multiplication des environnements, un apprentissage par renforcement mené sur plusieurs environnements et une introduction progressive de bruits environnementaux. L’association entre recherche agentique, outils et raisonnement intercalé convient aux tâches composées de plusieurs étapes. L’architecture parcimonieuse n’active que 27 milliards de paramètres sur les 560 milliards totaux à chaque traitement.

Limites et points d’attention. Un classement dans le top 25% sur GPQA reste en retrait du groupe de tête absolu de sa génération. Le Heavy Thinking Mode ajoute une phase de synthèse après plusieurs trajectoires parallèles, ce qui constitue un mécanisme plus élaboré qu’un raisonnement unique. Malgré l’activation partielle propre au Mixture-of-Experts, le modèle conserve 560 milliards de paramètres totaux, une échelle importante pour l’hébergement des poids. LongCat-Flash-Thinking-2601 vise principalement les expérimentations de raisonnement scientifique, les systèmes agentiques et les workflows reposant sur des outils, avec une licence MIT adaptée aux usages commerciaux.


Sources des données : LLM-Stats (llm-stats.com).