LongCat-Flash-Thinking-2601
Publié par Meituan le 14 janvier 2026, LongCat-Flash-Thinking-2601 est un modèle de raisonnement à poids ouverts sous licence MIT, utilisable commercialement. Son architecture Mixture-of-Experts réunit 560 milliards de paramètres au total, dont 27 milliards sont activés lors du traitement.
Publié par Meituan le 14 janvier 2026, LongCat-Flash-Thinking-2601 est un modèle de raisonnement à poids ouverts sous licence MIT, utilisable commercialement. Son architecture Mixture-of-Experts réunit 560 milliards de paramètres au total, dont 27 milliards sont activés lors du traitement.
Le modèle se distingue par son orientation agentique : usage d’outils, recherche autonome et raisonnement intégré aux outils. Son Heavy Thinking Mode combine plusieurs trajectoires de pensée parallèles avant une synthèse. Sa fenêtre de contexte atteint 128 000 tokens, tandis que son format de conversation gère la déclaration d’outils, la pensée intercalée et la conservation optionnelle du raisonnement entre les tours.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meituan |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 14 janvier 2026 |
| Multimodal | non |
| Paramètres | 560 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 99,6 % | 8ᵉ / 108 | llm-stats | Auto-déclaré |
| Tau2 Telecom | 99,3 % | 1ᵉ / 34 | llm-stats | Auto-déclaré |
| Tau2 Retail | 88,6 % | 4ᵉ / 25 | llm-stats | Auto-déclaré |
| LiveCodeBench | 82,8 % | 6ᵉ / 72 | llm-stats | Auto-déclaré |
| GPQA | 80,5 % | 77ᵉ / 219 | llm-stats | Auto-déclaré |
| IMO-AnswerBench | 78,6 % | 17ᵉ / 19 | llm-stats | Auto-déclaré |
| Tau2 Airline | 76,5 % | 1ᵉ / 22 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 70,0 % | 57ᵉ / 102 | llm-stats | Auto-déclaré |
| BrowseComp-zh | 69,0 % | 4ᵉ / 13 | llm-stats | Auto-déclaré |
| BrowseComp | 56,6 % | 37ᵉ / 57 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 25,2 % | 46ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. À sa sortie, LongCat-Flash-Thinking-2601 se classait dans le quart supérieur des LLM de sa génération sur GPQA, un benchmark consacré aux questions scientifiques complexes. Ce résultat le situait favorablement parmi les 158 modèles publiés au cours des quelque 18 mois précédents. Son entraînement cible directement les scénarios agentiques, avec une multiplication des environnements, un apprentissage par renforcement mené sur plusieurs environnements et une introduction progressive de bruits environnementaux. L’association entre recherche agentique, outils et raisonnement intercalé convient aux tâches composées de plusieurs étapes. L’architecture parcimonieuse n’active que 27 milliards de paramètres sur les 560 milliards totaux à chaque traitement.
Limites et points d’attention. Un classement dans le top 25% sur GPQA reste en retrait du groupe de tête absolu de sa génération. Le Heavy Thinking Mode ajoute une phase de synthèse après plusieurs trajectoires parallèles, ce qui constitue un mécanisme plus élaboré qu’un raisonnement unique. Malgré l’activation partielle propre au Mixture-of-Experts, le modèle conserve 560 milliards de paramètres totaux, une échelle importante pour l’hébergement des poids. LongCat-Flash-Thinking-2601 vise principalement les expérimentations de raisonnement scientifique, les systèmes agentiques et les workflows reposant sur des outils, avec une licence MIT adaptée aux usages commerciaux.
Sources des données : LLM-Stats (llm-stats.com).