Kwaipilot: KAT-Coder-Air V2.5

Kwaipilot: KAT-Coder-Air V2.5 est un LLM de kwaipilot, sorti le 10 juillet 2026. Il se distingue par une fenêtre de contexte de 256 000 tokens et par un positionnement tarifaire très économique.

Kwaipilot: KAT-Coder-Air V2.5 est un LLM de kwaipilot, sorti le 10 juillet 2026. Il se distingue par une fenêtre de contexte de 256 000 tokens et par un positionnement tarifaire très économique.

Le modèle associe ainsi la prise en charge de longues entrées à des coûts réduits. Son tarif se situe 93% sous la moyenne des LLM similaires, avec un écart particulièrement marqué face aux modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
Éditeurkwaipilot
Poids▫ n.d.
Date de sortie10 juillet 2026
Multimodalnon
Fenêtre de contexte256 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 161benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)97,0 %122ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)95,4 %20ᵉ / 140benchable✅ Mesuré
Benchable : Reasoning (Baseline)92,0 %50ᵉ / 155benchable✅ Mesuré
Benchable : Hallucinations (Baseline)91,7 %87ᵉ / 146benchable✅ Mesuré
Benchable : Coding (Baseline)84,0 %96ᵉ / 162benchable✅ Mesuré
Benchable : Instruction Following (Baseline)0,0 %145ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : General Knowledge (Baseline)

▶ KAT-Coder-Ai…100 %

Benchable : Ethics (Baseline)

▶ KAT-Coder-Ai…100 %
command-r-plus-08-202499 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
StreamLake0,15 $0,6 $0,03 $

Prix en dollars US par million de tokens.

Sa tarification se situe 93 % en dessous de la moyenne des LLM similaires, et 36,7 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable4 min 20 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Kwaipilot: KAT-Coder-Air V2.5 obtient son résultat le plus convaincant en Mathematics, où il figure parmi les 20 premiers modèles évalués. Il atteint aussi le plafond de General Knowledge et d’Ethics, même si cette première place est partagée respectivement avec 41 et 71 autres modèles. Sa fenêtre de 256 000 tokens constitue un autre atout pour les tâches nécessitant de longues entrées. Le prix renforce ce positionnement: 0,15 $ par million de tokens en entrée et 0,6 $ en sortie, soit environ 36,7 fois moins que les modèles frontière.

Limites et points d'attention. Le modèle se situe en retrait sur Email Classification, au 122e rang sur 163. Son classement sur Hallucinations reste également modeste, au 87e rang sur 146. Sur Reasoning, il partage la 50e place avec deux autres modèles, dans un benchmark plafonné et peu discriminant. Les scores maximaux en General Knowledge et Ethics ne suffisent donc pas à établir une supériorité. Le modèle convient surtout aux traitements à budget serré, aux longs contextes et aux tâches mathématiques.


Sources des données : OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai) · LLM-Stats (llm-stats.com).