Mistral: Mixtral 8x22B Instruct

Publié par Mistral AI le 17 avril 2024, Mixtral 8x22B Instruct appartient désormais à une génération ancienne à l’échelle de l’IA. Cette version de Mixtral 8x22B est affinée pour suivre des instructions. Ses poids sont ouverts, sa fenêtre de contexte atteint 65 536 tokens et ses…

Publié par Mistral AI le 17 avril 2024, Mixtral 8x22B Instruct appartient désormais à une génération ancienne à l’échelle de l’IA. Cette version de Mixtral 8x22B est affinée pour suivre des instructions. Ses poids sont ouverts, sa fenêtre de contexte atteint 65 536 tokens et ses connaissances s’arrêtent au 31 janvier 2024.

Le modèle adopte un positionnement économique, avec des tarifs inférieurs de 4% à la moyenne des LLM similaires et environ 2,8 fois plus bas que ceux des modèles frontière. Il prend en charge les appels de fonctions et s’intègre à mistral_common, mistral_inference et Hugging Face transformers.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMistral AI
Poids🟢 Poids ouverts
Date de sortie17 avril 2024
Connaissances jusqu'à2024-01-31
Multimodaloui
Fenêtre de contexte65 536 tokens
Modalités (entrée → sortie)text,file → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : General Knowledge (Baseline)95,5 %117ᵉ / 161benchable✅ Mesuré
Benchable : Ethics (Baseline)95,0 %136ᵉ / 159benchable✅ Mesuré
Benchable : Mathematics (Baseline)86,0 %89ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)83,0 %102ᵉ / 162benchable✅ Mesuré
Benchable : Email Classification (Baseline)80,0 %156ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)54,0 %114ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)50,0 %110ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ Mixtral 8x22B …100 %

Benchable : General Knowledge (Baseline)

▶ Mixtral 8x22B …96 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Mistral2 $6 $0,2 $

Prix en dollars US par million de tokens.

Sa tarification se situe 4 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,02 $
Latence moyenne par benchmark — Benchable2 min 28 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, Mixtral 8x22B Instruct associait des poids ouverts, une longue fenêtre de contexte et un format adapté aux échanges conversationnels. Son meilleur résultat brut concerne Hallucinations (Baseline), où il atteint le plafond du benchmark et partage la première place avec 45 autres modèles. Ce résultat reste peu discriminant. General Knowledge affiche également un score brut élevé, malgré un classement nettement moins favorable. L’intégration couvre l’encodage, le décodage et l’inférence, avec application d’un gabarit de conversation. Les appels de fonctions reposent sur des tokens spéciaux liés aux outils et sur des identifiants alphanumériques de neuf caractères.

Limites et points d'attention. Les classements Benchable placent aujourd’hui le modèle en retrait. Mathematics et Coding se situent dans la seconde moitié de leurs classements respectifs. Ethics approche le bas du tableau, tandis qu’Email Classification figure parmi les résultats les plus faibles. Le plafond atteint sur Hallucinations et les nombreux ex æquo sur General Knowledge et Mathematics réduisent aussi la portée comparative de ces scores. Près de deux ans après sa sortie, ses performances sont largement dépassées et ce type de modèle est souvent retiré du catalogue de son éditeur. La limite de connaissances au 31 janvier 2024 renforce ce vieillissement. Son principal avantage actuel reste son coût, sensiblement inférieur à celui des modèles haut de gamme.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).