Mistral: Mixtral 8x22B Instruct
Publié par Mistral AI le 17 avril 2024, Mixtral 8x22B Instruct appartient désormais à une génération ancienne à l’échelle de l’IA. Cette version de Mixtral 8x22B est affinée pour suivre des instructions. Ses poids sont ouverts, sa fenêtre de contexte atteint 65 536 tokens et ses…
Publié par Mistral AI le 17 avril 2024, Mixtral 8x22B Instruct appartient désormais à une génération ancienne à l’échelle de l’IA. Cette version de Mixtral 8x22B est affinée pour suivre des instructions. Ses poids sont ouverts, sa fenêtre de contexte atteint 65 536 tokens et ses connaissances s’arrêtent au 31 janvier 2024.
Le modèle adopte un positionnement économique, avec des tarifs inférieurs de 4% à la moyenne des LLM similaires et environ 2,8 fois plus bas que ceux des modèles frontière. Il prend en charge les appels de fonctions et s’intègre à mistral_common, mistral_inference et Hugging Face transformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 17 avril 2024 |
| Connaissances jusqu'à | 2024-01-31 |
| Multimodal | oui |
| Fenêtre de contexte | 65 536 tokens |
| Modalités (entrée → sortie) | text,file → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 95,5 % | 117ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 95,0 % | 136ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 86,0 % | 89ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 83,0 % | 102ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 80,0 % | 156ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 54,0 % | 114ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 50,0 % | 110ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Hallucinations (Baseline)
Benchable : General Knowledge (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Mistral | 2 $ | 6 $ | 0,2 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 4 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,02 $ |
| Latence moyenne par benchmark — Benchable | 2 min 28 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, Mixtral 8x22B Instruct associait des poids ouverts, une longue fenêtre de contexte et un format adapté aux échanges conversationnels. Son meilleur résultat brut concerne Hallucinations (Baseline), où il atteint le plafond du benchmark et partage la première place avec 45 autres modèles. Ce résultat reste peu discriminant. General Knowledge affiche également un score brut élevé, malgré un classement nettement moins favorable. L’intégration couvre l’encodage, le décodage et l’inférence, avec application d’un gabarit de conversation. Les appels de fonctions reposent sur des tokens spéciaux liés aux outils et sur des identifiants alphanumériques de neuf caractères.
Limites et points d'attention. Les classements Benchable placent aujourd’hui le modèle en retrait. Mathematics et Coding se situent dans la seconde moitié de leurs classements respectifs. Ethics approche le bas du tableau, tandis qu’Email Classification figure parmi les résultats les plus faibles. Le plafond atteint sur Hallucinations et les nombreux ex æquo sur General Knowledge et Mathematics réduisent aussi la portée comparative de ces scores. Près de deux ans après sa sortie, ses performances sont largement dépassées et ce type de modèle est souvent retiré du catalogue de son éditeur. La limite de connaissances au 31 janvier 2024 renforce ce vieillissement. Son principal avantage actuel reste son coût, sensiblement inférieur à celui des modèles haut de gamme.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).