WizardLM-2 8x22B

WizardLM-2 8x22B est un LLM à poids ouverts publié par Microsoft le 16 avril 2024. Près de deux ans plus tard, il est ancien à l’échelle de l’IA : ses performances sont probablement dépassées et le modèle n’est souvent plus proposé dans les catalogues actuels de l’éditeur.

WizardLM-2 8x22B est un LLM à poids ouverts publié par Microsoft le 16 avril 2024. Près de deux ans plus tard, il est ancien à l’échelle de l’IA : ses performances sont probablement dépassées et le modèle n’est souvent plus proposé dans les catalogues actuels de l’éditeur.

Son profil associe une fenêtre de contexte de 65 536 tokens à un tarif très économique de 0.62 $ par million de tokens, en entrée comme en sortie. Ce prix se situe 70 % sous la moyenne des LLM similaires et environ 8,9 fois sous celui des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMicrosoft
Poids🟢 Poids ouverts
Date de sortie16 avril 2024
Connaissances jusqu'à2024-04-30
Multimodalnon
Fenêtre de contexte65 536 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)98,0 %105ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)95,5 %117ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)95,0 %130ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)86,0 %89ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)62,0 %137ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)50,0 %123ᵉ / 155benchable✅ Mesuré
Epoch: GPQA diamond43,4 %54ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 525,7 %38ᵉ / 59epoch✅ Mesuré
Benchable : Instruction Following (Baseline)0,0 %145ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

olmo-3-32b-think98 %
▶ WizardLM-2 8x22B98 %

Benchable : General Knowledge (Baseline)

▶ WizardLM-2 8x22B96 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
NovitaAI0,62 $0,62 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 70 % en dessous de la moyenne des LLM similaires, et 8,9 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,02 $
Latence moyenne par benchmark — Benchable5 min 15 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, WizardLM-2 8x22B figurait dans le top 10 % des 21 LLM de sa génération sur GPQA diamond selon Epoch AI. Ce classement le situait dans le haut du panier de sa période. Sa fenêtre de contexte de 65 536 tokens offrait une capacité substantielle, tandis que ses poids ouverts le distinguaient des modèles fermés. Son coût constitue encore son avantage le plus net : les tokens d’entrée et de sortie sont facturés au même tarif, très inférieur à la moyenne des modèles comparables.

Limites et points d’attention. Les évaluations Benchable montrent des faiblesses marquées. Le modèle tombe au 137e rang sur 162 en Coding. Il reste également en retrait en Reasoning et se place dans la seconde moitié du classement en Mathematics. Ses scores bruts élevés en Ethics, General Knowledge et Email Classification sont peu discriminants : ces benchmarks sont plafonnés et le modèle y partage des places au-delà du 100e rang. Ses connaissances s’arrêtent au 2024-04-30. Aujourd’hui, ses performances sont largement dépassées et son ancienneté réduit fortement sa pertinence face aux LLM plus récents.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).