LongCat-Flash-Lite
Publié par Meituan le 5 février 2026, LongCat-Flash-Lite est un LLM open weights sous licence MIT, utilisable commercialement. Son architecture Mixture-of-Experts non-thinking compte 68,5 milliards de paramètres, dont environ 3 milliards sont activés lors de l’inférence.
Publié par Meituan le 5 février 2026, LongCat-Flash-Lite est un LLM open weights sous licence MIT, utilisable commercialement. Son architecture Mixture-of-Experts non-thinking compte 68,5 milliards de paramètres, dont environ 3 milliards sont activés lors de l’inférence.
Le modèle se distingue par une fenêtre de contexte de 256 000 tokens reposant sur YaRN et par une table d’embeddings N-gram de plus de 30 milliards de paramètres, conçue pour améliorer les performances et la vitesse d’inférence. Son positionnement est très économique, avec des tarifs inférieurs de 95 % à la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Meituan |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 5 février 2026 |
| Multimodal | non |
| Paramètres | 68 milliards |
| Fenêtre de contexte | 256 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MATH-500 | 96,8 % | 10ᵉ / 31 | llm-stats | Auto-déclaré |
| MMLU | 85,5 % | 36ᵉ / 98 | llm-stats | Auto-déclaré |
| CMMLU | 82,5 % | 4ᵉ / 6 | llm-stats | Auto-déclaré |
| MMLU-Pro | 78,3 % | 57ᵉ / 125 | llm-stats | Auto-déclaré |
| Tau2 Retail | 73,1 % | 14ᵉ / 25 | llm-stats | Auto-déclaré |
| Tau2 Telecom | 72,8 % | 24ᵉ / 34 | llm-stats | Auto-déclaré |
| AIME 2024 | 72,2 % | 37ᵉ / 52 | llm-stats | Auto-déclaré |
| GPQA | 66,8 % | 128ᵉ / 219 | llm-stats | Auto-déclaré |
| AIME 2025 | 63,2 % | 88ᵉ / 108 | llm-stats | Auto-déclaré |
| Tau2 Airline | 58,0 % | 12ᵉ / 22 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 54,4 % | 83ᵉ / 102 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 38,1 % | 33ᵉ / 34 | llm-stats | Auto-déclaré |
| Terminal-Bench | 33,8 % | 15ᵉ / 25 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| meituan | 0,1 $ | 0,4 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 55 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Notre analyse
Forces. LongCat-Flash-Lite combine une grande fenêtre de contexte avec une activation limitée à environ 3 milliards de paramètres, un choix orienté vers l’efficacité d’inférence. L’architecture ajoute un N-gram Cache, des kernels synchronisés et une table d’embeddings N-gram. Le déploiement est prévu avec Transformers ou SGLang, avec parallélisme tensoriel et parallélisme d’experts, tandis que le tool calling couvre les usages agentiques. À sa sortie, son résultat sur GPQA le plaçait dans le top 57 % des 166 LLM de sa génération. Son principal avantage reste économique : il coûte environ 55 fois moins cher que les modèles frontière, avec une entrée à 0,1 $ par million de tokens et une sortie à 0,4 $.
Limites et points d’attention. Le classement GPQA situe LongCat-Flash-Lite dans une zone intermédiaire de sa génération, loin du groupe de tête sur ce benchmark de raisonnement. Son architecture non-thinking le distingue également des modèles conçus autour d’un raisonnement explicite. Il cible surtout les déploiements sensibles au coût dans les domaines généraux, le codage, le raisonnement mathématique et l’usage agentique d’outils.
Sources des données : LLM-Stats (llm-stats.com).