Mistral: Codestral 2508

Sorti le 1 août 2025, Mistral: Codestral 2508 est un LLM de Mistral AI. Il se distingue par une fenêtre de contexte de 256 000 tokens, adaptée au traitement de longues séquences. Ses connaissances s’arrêtent au 31 mars 2025.

Sorti le 1 août 2025, Mistral: Codestral 2508 est un LLM de Mistral AI. Il se distingue par une fenêtre de contexte de 256 000 tokens, adaptée au traitement de longues séquences. Ses connaissances s’arrêtent au 31 mars 2025.

Son positionnement tarifaire est très économique. Sa tarification se situe 86% sous la moyenne des LLM similaires et environ 18.3 fois sous celle des modèles frontière. Codestral 2508 associe ainsi un contexte étendu à un faible coût d’utilisation.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMistral AI
Poids▫ n.d.
Date de sortie1 août 2025
Connaissances jusqu'à2025-03-31
Multimodaloui
Fenêtre de contexte256 000 tokens
Modalités (entrée → sortie)text,file → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)97,0 %126ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)94,0 %135ᵉ / 163benchable✅ Mesuré
Benchable : Instruction Following (Baseline)57,0 %95ᵉ / 163benchable✅ Mesuré
Benchable : General Knowledge (Baseline)49,5 %147ᵉ / 161benchable✅ Mesuré
Benchable : Coding (Baseline)48,0 %141ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)46,0 %128ᵉ / 155benchable✅ Mesuré
Benchable : Mathematics (Baseline)3,0 %132ᵉ / 140benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

▶ Codestral 250897 %

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
▶ Codestral 250894 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Mistral0,3 $0,9 $0,03 $

Prix en dollars US par million de tokens.

Sa tarification se situe 86 % en dessous de la moyenne des LLM similaires, et 18,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable8 min 09 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Les meilleurs scores bruts de Codestral 2508 concernent Ethics et Email Classification. Ces deux benchmarks sont toutefois plafonnés et non discriminants, avec des places partagées entre plusieurs modèles. Instruction Following constitue son résultat le plus solide parmi les évaluations discriminantes fournies, même si le modèle reste dans la seconde moitié du classement. Sa fenêtre de 256 000 tokens et son tarif très inférieur à la moyenne forment ses avantages les plus nets pour traiter de longues séquences à coût contenu.

Limites et points d’attention. Les performances générales restent en retrait. Le modèle se classe près du bas du tableau en General Knowledge et en Coding. Ce résultat en Coding limite particulièrement son intérêt dès qu’un niveau élevé de production ou d’analyse de code est recherché. Reasoning affiche également un classement faible, sur un benchmark lui-même plafonné et non discriminant. Codestral 2508 convient surtout aux usages sensibles au coût et nécessitant un grand contexte, lorsque des performances de référence en raisonnement, en connaissances générales ou en code ne sont pas prioritaires.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).