LongCat-Flash-Thinking
Publié par Meituan le 22 septembre 2025, LongCat-Flash-Thinking est un LLM de raisonnement open weights sous licence MIT, utilisable commercialement. À sa sortie, ses résultats sur GPQA le plaçaient dans le haut du panier des modèles de sa génération.
Publié par Meituan le 22 septembre 2025, LongCat-Flash-Thinking est un LLM de raisonnement open weights sous licence MIT, utilisable commercialement. À sa sortie, ses résultats sur GPQA le plaçaient dans le haut du panier des modèles de sa génération.
Ses 560 milliards de paramètres reposent sur une architecture Mixture-of-Experts qui en active dynamiquement 18,6 à 31,3 milliards selon le contexte. Son entraînement combine un démarrage Long CoT, un apprentissage par renforcement à grande échelle, le système DORA et une méthode parallèle spécialisée par domaines.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meituan |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 22 septembre 2025 |
| Multimodal | non |
| Paramètres | 560 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MATH-500 | 99,2 % | 1ᵉ / 31 | llm-stats | Auto-déclaré |
| ZebraLogic | 95,5 % | 2ᵉ / 7 | llm-stats | Auto-déclaré |
| AIME 2024 | 93,3 % | 3ᵉ / 52 | llm-stats | Auto-déclaré |
| AIME 2025 | 90,6 % | 42ᵉ / 108 | llm-stats | Auto-déclaré |
| MMLU-Redux | 89,3 % | 26ᵉ / 48 | llm-stats | Auto-déclaré |
| Tau2 Telecom | 83,1 % | 19ᵉ / 34 | llm-stats | Auto-déclaré |
| MMLU-Pro | 82,6 % | 33ᵉ / 125 | llm-stats | Auto-déclaré |
| GPQA | 81,5 % | 69ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench | 79,4 % | 10ᵉ / 72 | llm-stats | Auto-déclaré |
| BFCL-v3 | 74,4 % | 3ᵉ / 19 | llm-stats | Auto-déclaré |
| Tau2 Retail | 71,5 % | 16ᵉ / 25 | llm-stats | Auto-déclaré |
| Tau2 Airline | 67,5 % | 3ᵉ / 22 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 59,4 % | 78ᵉ / 102 | llm-stats | Auto-déclaré |
| ARC-AGI | 50,3 % | 6ᵉ / 7 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. LongCat-Flash-Thinking se distingue d'abord en raisonnement général : à sa sortie, il figurait dans le top 12% des 130 LLM de sa génération sur GPQA, un benchmark centré sur des questions scientifiques difficiles. Son champ fonctionnel couvre aussi le raisonnement formel et agentique, notamment les mathématiques, la logique, la programmation, la preuve automatique de théorèmes et l'utilisation d'outils. La fenêtre de contexte de 128 000 tokens convient au traitement de séquences longues. Les formats prévus pour le chat mono-tour, multi-tour et les appels d'outils facilitent plusieurs modes d'intégration. La licence MIT autorise en outre les usages commerciaux.
Limites et points d'attention. Malgré l'activation sélective propre à son architecture Mixture-of-Experts, le modèle totalise 560 milliards de paramètres, tandis que 18,6 à 31,3 milliards sont mobilisés selon le contexte. Cette variation rend la charge de calcul dépendante des requêtes. L'évaluation comparative disponible repose sur GPQA et sur une seule source de données concordante, ce qui situe solidement son raisonnement scientifique à son époque sans étendre cette conclusion à tous ses domaines déclarés. LongCat-Flash-Thinking cible ainsi les projets de raisonnement avancé, de programmation, de preuve formelle et d'agents utilisant des outils.
Sources des données : LLM-Stats (llm-stats.com).