Qwen3 32B

Publié par Qwen le 29 avril 2025, Qwen3 32B appartient déjà à une génération ancienne à l’échelle de l’IA. Près d’un an après sa sortie, ses performances sont probablement dépassées, mais son prix très économique et sa licence Apache 2.0 ouverte à l’usage commercial préservent son…

Publié par Qwen le 29 avril 2025, Qwen3 32B appartient déjà à une génération ancienne à l’échelle de l’IA. Près d’un an après sa sortie, ses performances sont probablement dépassées, mais son prix très économique et sa licence Apache 2.0 ouverte à l’usage commercial préservent son intérêt pour un déploiement maîtrisé.

Ce LLM causal de 33 milliards de paramètres combine un mode thinking pour le raisonnement, les mathématiques et le code, et un mode non-thinking destiné au dialogue général. Il prend en charge plus de 100 langues et dialectes, l’appel d’outils et un contexte extensible jusqu’à 131 072 tokens.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie29 avril 2025
Multimodalnon
Paramètres33 milliards
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Arena Hard93,8 %2ᵉ / 26llm-statsAuto-déclaré
AIME 202481,4 %22ᵉ / 52llm-statsAuto-déclaré
LiveBench74,9 %15ᵉ / 38llm-statsAuto-déclaré
AIME 202572,9 %76ᵉ / 108llm-statsAuto-déclaré
BFCL70,3 %6ᵉ / 11llm-statsAuto-déclaré
CodeForces65,9 %13ᵉ / 16llm-statsAuto-déclaré
LiveCodeBench65,7 %26ᵉ / 72llm-statsAuto-déclaré
Aider50,2 %4ᵉ / 4llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
185ᵉamazon-nova-experimental-chat-10-091348
186ᵉLlama 3.1 Nemotron Ultra 253B v11347
187ᵉQwen3 32B1347
188ᵉMercury 21347
189ᵉling-flash-2.01346

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,08 $0,28 $n.d.
deepinfra0,1 $0,3 $n.d.
novita0,1 $0,44 $n.d.
sambanova0,4 $0,8 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 96 % en dessous de la moyenne des LLM similaires, et 68,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Notre analyse

Forces. À sa sortie, Qwen3 32B associait une architecture dense de 32,8 milliards de paramètres, 64 couches et une attention GQA à deux régimes d’utilisation distincts. La bascule entre thinking et non-thinking adapte le fonctionnement aux tâches de raisonnement ou aux échanges généraux. La compatibilité avec Qwen-Agent, SGLang, vLLM, transformers et d’autres outils locaux facilite les usages agentiques et l’hébergement autonome. Son contexte natif de 32 768 tokens peut atteindre 131 072 tokens avec YaRN. Son coût constitue son avantage le plus net : la tarification se situe 96% sous la moyenne des LLM similaires, avec un écart d’environ 68,8 fois face aux modèles frontière.

Limites et points d'attention. Son classement Arena text le place désormais dans le bas du tableau, très loin du modèle en tête, ce qui confirme un recul marqué face aux références plus récentes. Près d’un an représente une ancienneté très longue dans ce secteur : cette génération est probablement largement dépassée et les modèles de cet âge sont souvent retirés du catalogue de leur éditeur. L’extension du contexte maximal repose par ailleurs sur YaRN, tandis que la longueur native reste limitée à 32 768 tokens. Son intérêt actuel tient donc davantage à son faible coût, à ses poids ouverts et à sa souplesse de déploiement qu’à un niveau de performance de premier plan.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai).