Kwaipilot: KAT-Coder-Air V2.5
Kwaipilot: KAT-Coder-Air V2.5 est un LLM de kwaipilot, sorti le 10 juillet 2026. Il se distingue par une fenêtre de contexte de 256 000 tokens et par un positionnement tarifaire très économique.
Kwaipilot: KAT-Coder-Air V2.5 est un LLM de kwaipilot, sorti le 10 juillet 2026. Il se distingue par une fenêtre de contexte de 256 000 tokens et par un positionnement tarifaire très économique.
Le modèle associe ainsi la prise en charge de longues entrées à des coûts réduits. Son tarif se situe 93% sous la moyenne des LLM similaires, avec un écart particulièrement marqué face aux modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | kwaipilot |
| Poids | ▫ n.d. |
| Date de sortie | 10 juillet 2026 |
| Multimodal | non |
| Fenêtre de contexte | 256 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 97,0 % | 122ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 95,4 % | 20ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 92,0 % | 50ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 91,7 % | 87ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 84,0 % | 96ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 0,0 % | 145ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : General Knowledge (Baseline)
Benchable : Ethics (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| StreamLake | 0,15 $ | 0,6 $ | 0,03 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 93 % en dessous de la moyenne des LLM similaires, et 36,7 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 4 min 20 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Kwaipilot: KAT-Coder-Air V2.5 obtient son résultat le plus convaincant en Mathematics, où il figure parmi les 20 premiers modèles évalués. Il atteint aussi le plafond de General Knowledge et d’Ethics, même si cette première place est partagée respectivement avec 41 et 71 autres modèles. Sa fenêtre de 256 000 tokens constitue un autre atout pour les tâches nécessitant de longues entrées. Le prix renforce ce positionnement: 0,15 $ par million de tokens en entrée et 0,6 $ en sortie, soit environ 36,7 fois moins que les modèles frontière.
Limites et points d'attention. Le modèle se situe en retrait sur Email Classification, au 122e rang sur 163. Son classement sur Hallucinations reste également modeste, au 87e rang sur 146. Sur Reasoning, il partage la 50e place avec deux autres modèles, dans un benchmark plafonné et peu discriminant. Les scores maximaux en General Knowledge et Ethics ne suffisent donc pas à établir une supériorité. Le modèle convient surtout aux traitements à budget serré, aux longs contextes et aux tâches mathématiques.
Sources des données : OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai) · LLM-Stats (llm-stats.com).