Meituan: LongCat 2.0

Sorti le 20 juillet 2026, Meituan: LongCat 2.0 est un LLM à poids ouverts qui mise sur une fenêtre de contexte d’environ 1,0 million de tokens, le code et les workflows agentiques. Son tarif se situe 86% sous la moyenne des LLM similaires.

Sorti le 20 juillet 2026, Meituan: LongCat 2.0 est un LLM à poids ouverts qui mise sur une fenêtre de contexte d’environ 1,0 million de tokens, le code et les workflows agentiques. Son tarif se situe 86% sous la moyenne des LLM similaires.

Son architecture MoE réunit 1.6 billion de paramètres, dont environ 48 milliards sont activés par token, ainsi que 135 milliards de paramètres d’embedding N-gram. LongCat Sparse Attention combine indexation adaptée au streaming, indexation inter-couches et indexation hiérarchique.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMeituan
Poids🟢 Poids ouverts
Date de sortie20 juillet 2026
Multimodalnon
Fenêtre de contexte1 048 756 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 258benchable✅ Mesuré
Benchable : Reasoning (Baseline)100,0 %1ᵉ / 249benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 257benchable✅ Mesuré
Benchable : Coding (Baseline)97,0 %8ᵉ / 259benchable✅ Mesuré
Benchable : Mathematics (Baseline)96,8 %11ᵉ / 230benchable✅ Mesuré
Benchable : Email Classification (Baseline)96,0 %208ᵉ / 263benchable✅ Mesuré
Benchable : Hallucinations (Baseline)94,0 %136ᵉ / 239benchable✅ Mesuré
Benchable : Instruction Following (Baseline)76,8 %72ᵉ / 261benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : General Knowledge (Baseline)

▶ LongCat 2.0100 %

Benchable : Reasoning (Baseline)

▶ LongCat 2.0100 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
AtlasCloud0,3 $1,2 $0,006 $

Prix en dollars US par million de tokens.

Sa tarification se situe 86 % en dessous de la moyenne des LLM similaires, et 18,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,07 $
Latence moyenne par benchmark — Benchable36 min 03 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. LongCat 2.0 se place dans le top 10 du benchmark Coding, à égalité avec un autre modèle, et proche du top 10 en Mathematics. Sa fenêtre de 1 048 756 tokens correspond à son entraînement sur des contextes d’un million de tokens. Le modèle de conversation propose les appels d’outils et un mode de réflexion. Il s’intègre à Claude Code, OpenClaw et Hermes, avec des déploiements possibles sur GPU ou NPU. Son prix très économique constitue un autre atout concret : il coûte environ 18.3 fois moins cher que les modèles frontière.

Limites et points d’attention. Les scores maximaux en General Knowledge, Reasoning et Ethics sont partagés avec de nombreux modèles. Ces benchmarks plafonnés ne départagent donc pas réellement LongCat 2.0 de ses concurrents. Coding présente la même limite malgré son classement élevé. En Email Classification, le modèle reste en retrait du classement, même avec un score brut élevé, ce qui illustre également la faible capacité discriminante de ce test. Enfin, ses 1.6 billion de paramètres totaux représentent une architecture particulièrement volumineuse, malgré l’activation d’environ 48 milliards de paramètres par token. LongCat 2.0 cible surtout le code, les agents outillés et le traitement de contextes très longs à coût réduit.


Sources des données : OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).