Qwen3 32B
Publié par Qwen le 29 avril 2025, Qwen3 32B appartient déjà à une génération ancienne à l’échelle de l’IA. Près d’un an après sa sortie, ses performances sont probablement dépassées, mais son prix très économique et sa licence Apache 2.0 ouverte à l’usage commercial préservent son…
Publié par Qwen le 29 avril 2025, Qwen3 32B appartient déjà à une génération ancienne à l’échelle de l’IA. Près d’un an après sa sortie, ses performances sont probablement dépassées, mais son prix très économique et sa licence Apache 2.0 ouverte à l’usage commercial préservent son intérêt pour un déploiement maîtrisé.
Ce LLM causal de 33 milliards de paramètres combine un mode thinking pour le raisonnement, les mathématiques et le code, et un mode non-thinking destiné au dialogue général. Il prend en charge plus de 100 langues et dialectes, l’appel d’outils et un contexte extensible jusqu’à 131 072 tokens.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 29 avril 2025 |
| Multimodal | non |
| Paramètres | 33 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Arena Hard | 93,8 % | 2ᵉ / 26 | llm-stats | Auto-déclaré |
| AIME 2024 | 81,4 % | 22ᵉ / 52 | llm-stats | Auto-déclaré |
| LiveBench | 74,9 % | 15ᵉ / 38 | llm-stats | Auto-déclaré |
| AIME 2025 | 72,9 % | 76ᵉ / 108 | llm-stats | Auto-déclaré |
| BFCL | 70,3 % | 6ᵉ / 11 | llm-stats | Auto-déclaré |
| CodeForces | 65,9 % | 13ᵉ / 16 | llm-stats | Auto-déclaré |
| LiveCodeBench | 65,7 % | 26ᵉ / 72 | llm-stats | Auto-déclaré |
| Aider | 50,2 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 185ᵉ | amazon-nova-experimental-chat-10-09 | 1348 |
| 186ᵉ | Llama 3.1 Nemotron Ultra 253B v1 | 1347 |
| 187ᵉ | Qwen3 32B | 1347 |
| 188ᵉ | Mercury 2 | 1347 |
| 189ᵉ | ling-flash-2.0 | 1346 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,08 $ | 0,28 $ | n.d. |
| deepinfra | 0,1 $ | 0,3 $ | n.d. |
| novita | 0,1 $ | 0,44 $ | n.d. |
| sambanova | 0,4 $ | 0,8 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 96 % en dessous de la moyenne des LLM similaires, et 68,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Notre analyse
Forces. À sa sortie, Qwen3 32B associait une architecture dense de 32,8 milliards de paramètres, 64 couches et une attention GQA à deux régimes d’utilisation distincts. La bascule entre thinking et non-thinking adapte le fonctionnement aux tâches de raisonnement ou aux échanges généraux. La compatibilité avec Qwen-Agent, SGLang, vLLM, transformers et d’autres outils locaux facilite les usages agentiques et l’hébergement autonome. Son contexte natif de 32 768 tokens peut atteindre 131 072 tokens avec YaRN. Son coût constitue son avantage le plus net : la tarification se situe 96% sous la moyenne des LLM similaires, avec un écart d’environ 68,8 fois face aux modèles frontière.
Limites et points d'attention. Son classement Arena text le place désormais dans le bas du tableau, très loin du modèle en tête, ce qui confirme un recul marqué face aux références plus récentes. Près d’un an représente une ancienneté très longue dans ce secteur : cette génération est probablement largement dépassée et les modèles de cet âge sont souvent retirés du catalogue de leur éditeur. L’extension du contexte maximal repose par ailleurs sur YaRN, tandis que la longueur native reste limitée à 32 768 tokens. Son intérêt actuel tient donc davantage à son faible coût, à ses poids ouverts et à sa souplesse de déploiement qu’à un niveau de performance de premier plan.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai).