Mixtral 8x22B
Mixtral 8x22B est un LLM publié par Mistral AI le 17 avril 2024. À sa sortie, il se plaçait dans la moitié supérieure des modèles de sa génération sur GPQA diamond, un test consacré aux questions scientifiques de niveau doctorat.
Mixtral 8x22B est un LLM publié par Mistral AI le 17 avril 2024. À sa sortie, il se plaçait dans la moitié supérieure des modèles de sa génération sur GPQA diamond, un test consacré aux questions scientifiques de niveau doctorat.
Près de deux ans plus tard, son ancienneté est très longue à l’échelle de l’IA. Mixtral 8x22B représente désormais davantage une étape de la génération 2024 qu’un modèle au niveau des systèmes récents, ses résultats actuels le situant loin des premières places.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | ▫ n.d. |
| Date de sortie | 17 avril 2024 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: GPQA diamond | 34,1 % | 68ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: MATH level 5 | 24,2 % | 41ᵉ / 59 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: GPQA diamond
Epoch: MATH level 5
Notre analyse
Forces. À sa sortie, Mixtral 8x22B appartenait au top 48% des LLM de sa génération sur GPQA diamond. Ce positionnement le plaçait dans la moitié supérieure des 27 modèles contemporains évalués, avec une capacité mesurable à traiter des questions scientifiques complexes. Les deux sources de données disponibles concordent sur cette évaluation.
Limites et points d'attention. Le recul est net face à un ensemble de modèles plus récents. Sur GPQA diamond, Mixtral 8x22B figure aujourd’hui dans le bas du classement général. Son résultat sur MATH level 5 est également faible et le place dans la partie inférieure du panel évalué, ce qui signale des limites sur les problèmes mathématiques les plus difficiles. Après près de deux ans, ses performances sont largement dépassées à l’échelle de l’IA, et les modèles de cette ancienneté sont souvent retirés des catalogues des éditeurs.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.