LongCat-Flash-Lite

Publié par Meituan le 5 février 2026, LongCat-Flash-Lite est un LLM open weights sous licence MIT, utilisable commercialement. Son architecture Mixture-of-Experts non-thinking compte 68,5 milliards de paramètres, dont environ 3 milliards sont activés lors de l’inférence.

Publié par Meituan le 5 février 2026, LongCat-Flash-Lite est un LLM open weights sous licence MIT, utilisable commercialement. Son architecture Mixture-of-Experts non-thinking compte 68,5 milliards de paramètres, dont environ 3 milliards sont activés lors de l’inférence.

Le modèle se distingue par une fenêtre de contexte de 256 000 tokens reposant sur YaRN et par une table d’embeddings N-gram de plus de 30 milliards de paramètres, conçue pour améliorer les performances et la vitesse d’inférence. Son positionnement est très économique, avec des tarifs inférieurs de 95 % à la moyenne des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeituan
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie5 février 2026
Multimodalnon
Paramètres68 milliards
Fenêtre de contexte256 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MATH-50096,8 %10ᵉ / 31llm-statsAuto-déclaré
MMLU85,5 %36ᵉ / 98llm-statsAuto-déclaré
CMMLU82,5 %4ᵉ / 6llm-statsAuto-déclaré
MMLU-Pro78,3 %57ᵉ / 125llm-statsAuto-déclaré
Tau2 Retail73,1 %14ᵉ / 25llm-statsAuto-déclaré
Tau2 Telecom72,8 %24ᵉ / 34llm-statsAuto-déclaré
AIME 202472,2 %37ᵉ / 52llm-statsAuto-déclaré
GPQA66,8 %128ᵉ / 219llm-statsAuto-déclaré
AIME 202563,2 %88ᵉ / 108llm-statsAuto-déclaré
Tau2 Airline58,0 %12ᵉ / 22llm-statsAuto-déclaré
SWE-Bench Verified54,4 %83ᵉ / 102llm-statsAuto-déclaré
SWE-bench Multilingual38,1 %33ᵉ / 34llm-statsAuto-déclaré
Terminal-Bench33,8 %15ᵉ / 25llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
meituan0,1 $0,4 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 55 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Notre analyse

Forces. LongCat-Flash-Lite combine une grande fenêtre de contexte avec une activation limitée à environ 3 milliards de paramètres, un choix orienté vers l’efficacité d’inférence. L’architecture ajoute un N-gram Cache, des kernels synchronisés et une table d’embeddings N-gram. Le déploiement est prévu avec Transformers ou SGLang, avec parallélisme tensoriel et parallélisme d’experts, tandis que le tool calling couvre les usages agentiques. À sa sortie, son résultat sur GPQA le plaçait dans le top 57 % des 166 LLM de sa génération. Son principal avantage reste économique : il coûte environ 55 fois moins cher que les modèles frontière, avec une entrée à 0,1 $ par million de tokens et une sortie à 0,4 $.

Limites et points d’attention. Le classement GPQA situe LongCat-Flash-Lite dans une zone intermédiaire de sa génération, loin du groupe de tête sur ce benchmark de raisonnement. Son architecture non-thinking le distingue également des modèles conçus autour d’un raisonnement explicite. Il cible surtout les déploiements sensibles au coût dans les domaines généraux, le codage, le raisonnement mathématique et l’usage agentique d’outils.


Sources des données : LLM-Stats (llm-stats.com).