Qwen3 235B A22B
Qwen3 235B A22B est un LLM open-weights de Qwen, publié le 25 juillet 2025 sous licence Apache 2.0, avec usage commercial autorisé. Cette architecture mixture-of-experts réunit 235 milliards de paramètres, dont 22 milliards activés, répartis entre 128 experts et 94 couches.
Qwen3 235B A22B est un LLM open-weights de Qwen, publié le 25 juillet 2025 sous licence Apache 2.0, avec usage commercial autorisé. Cette architecture mixture-of-experts réunit 235 milliards de paramètres, dont 22 milliards activés, répartis entre 128 experts et 94 couches.
Le modèle distingue un mode « thinking » consacré au raisonnement et un mode « non-thinking » destiné au dialogue général. Il prend en charge la génération de code, les appels d’outils et plus de 100 langues et dialectes. Son contexte natif de 32 768 tokens peut atteindre 131 072 tokens via YaRN. Son entraînement représente environ 1,3 million d’heures-GPU H100.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 29 avril 2025 |
| Multimodal | non |
| Paramètres | 235 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Arena Hard | 95,6 % | 1ᵉ / 26 | llm-stats | Auto-déclaré |
| GSM8k | 94,4 % | 16ᵉ / 47 | llm-stats | Auto-déclaré |
| BBH | 88,9 % | 1ᵉ / 12 | llm-stats | Auto-déclaré |
| MMLU | 87,8 % | 18ᵉ / 98 | llm-stats | Auto-déclaré |
| MMLU-Redux | 87,4 % | 31ᵉ / 48 | llm-stats | Auto-déclaré |
| MMMLU | 86,7 % | 21ᵉ / 49 | llm-stats | Auto-déclaré |
| AIME 2024 | 85,7 % | 17ᵉ / 52 | llm-stats | Auto-déclaré |
| MGSM | 83,5 % | 15ᵉ / 30 | llm-stats | Auto-déclaré |
| AIME 2025 | 81,5 % | 62ᵉ / 108 | llm-stats | Auto-déclaré |
| MBPP | 81,4 % | 11ᵉ / 33 | llm-stats | Auto-déclaré |
| EvalPlus | 77,6 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| LiveBench | 77,1 % | 7ᵉ / 38 | llm-stats | Auto-déclaré |
| Include | 73,5 % | 19ᵉ / 31 | llm-stats | Auto-déclaré |
| MATH | 71,8 % | 34ᵉ / 70 | llm-stats | Auto-déclaré |
| BFCL | 70,8 % | 5ᵉ / 11 | llm-stats | Auto-déclaré |
| LiveCodeBench | 70,7 % | 21ᵉ / 72 | llm-stats | Auto-déclaré |
| MMLU-Pro | 68,2 % | 87ᵉ / 125 | llm-stats | Auto-déclaré |
| MultiPL-E | 65,9 % | 11ᵉ / 13 | llm-stats | Auto-déclaré |
| Aider | 61,8 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| GPQA | 47,5 % | 170ᵉ / 219 | llm-stats | Auto-déclaré |
| SuperGPQA | 44,1 % | 31ᵉ / 34 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 122ᵉ | Grok 4 Fast | 1404 |
| 123ᵉ | GPT-5.4 nano | 1404 |
| 124ᵉ | Qwen3 235B A22B | 1403 |
| 125ᵉ | o1 | 1402 |
| 126ᵉ | Qwen3-Next-80B-A3B-Instruct | 1401 |
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 122ᵉ | Grok 4 Fast | 1404 |
| 123ᵉ | GPT-5.4 nano | 1404 |
| 124ᵉ | Qwen3 235B A22B | 1403 |
| 125ᵉ | o1 | 1402 |
| 126ᵉ | Qwen3-Next-80B-A3B-Instruct | 1401 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Alibaba Cloud Int. | 0,455 $ | 1,82 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 78 % en dessous de la moyenne des LLM similaires, et 12,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 4,8 × 10²⁴ FLOP |
| Taille du jeu d'entraînement | 3,6 × 10¹³ |
| Jeu de données | Unspecified unreleased |
| Pays | China |
Notre analyse
Forces. À sa sortie, Qwen3 235B A22B figurait dans le top 8% des LLM de sa génération sur GPQA diamond, qui évalue les questions scientifiques de niveau doctorat. Ses résultats sur OTIS Mock AIME et MATH level 5 confirment de bonnes aptitudes en mathématiques exigeantes, tandis que SimpleQA Verified le place dans le premier tiers pour les réponses factuelles vérifiables. Son principal avantage pratique reste son positionnement très économique : sa tarification se situe 77% sous la moyenne des LLM similaires et environ 12,1 fois sous celle des modèles frontière.
Limites et points d'attention. Les classements Arena text placent le modèle dans la partie basse des 200 modèles évalués, malgré des résultats spécialisés plus convaincants. Il se situe également près du bas du classement en résolution de problèmes d’échecs. FrontierMath, consacré aux mathématiques de recherche très difficiles, constitue sa faiblesse la plus nette, avec un score nul. La fenêtre de 131 072 tokens repose sur YaRN, le contexte natif étant limité à 32 768 tokens. Qwen3 235B A22B convient surtout aux usages multilingues, au raisonnement scientifique et mathématique, ainsi qu’aux déploiements sensibles au coût et nécessitant des poids ouverts.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.