Qwen: Qwen3 30B A3B Instruct 2507
Publié le 29 juillet 2025 par Alibaba Cloud et la Qwen Team, Qwen3 30B A3B Instruct 2507 est un LLM à poids ouverts. Cette architecture Qwen3-MoE compte 30.5 milliards de paramètres, dont 3.3 milliards activés, avec 128 experts et 8 experts mobilisés. Elle fonctionne uniquement en mode…
Publié le 29 juillet 2025 par Alibaba Cloud et la Qwen Team, Qwen3 30B A3B Instruct 2507 est un LLM à poids ouverts. Cette architecture Qwen3-MoE compte 30.5 milliards de paramètres, dont 3.3 milliards activés, avec 128 experts et 8 experts mobilisés. Elle fonctionne uniquement en mode non-thinking.
Le modèle couvre plusieurs langues et des connaissances de longue traîne arrêtées au 30 juin 2025. Son contexte natif atteint 262 144 tokens, avec une configuration étendue jusqu’à environ 1 million de tokens via Dual Chunk Attention et MInference. Transformers, SGLang, vLLM et les endpoints compatibles OpenAI font partie des options d’utilisation et de déploiement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 29 juillet 2025 |
| Connaissances jusqu'à | 2025-06-30 |
| Multimodal | non |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Keyword Topic Relevance Classification | 100,0 % | 1ᵉ / 6 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 98,0 % | 47ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 97,0 % | 102ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 94,0 % | 30ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 94,0 % | 135ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 93,0 % | 42ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 78,0 % | 76ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 59,8 % | 91ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Keyword Topic Relevance Classification
Benchable : Ethics (Baseline)
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 148ᵉ | mistral-medium-2505 | 1387 |
| 149ᵉ | minimax-m2.1-preview | 1384 |
| 150ᵉ | Qwen: Qwen3 30B A3B Instruct 2507 | 1383 |
| 151ᵉ | GPT-4.1 mini | 1383 |
| 152ᵉ | Hunyuan-TurboS | 1382 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| StreamLake | 0,04815 $ | 0,19305 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 98 % en dessous de la moyenne des LLM similaires, et 114,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 3 min 16 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Le modèle obtient son classement Benchable le plus solide sur Mathematics, où il partage la 30e place sur 140. Il se classe aussi 47e sur 146 dans Hallucinations. Ses scores parfaits en Keyword Topic Relevance Classification et Ethics sont partagés avec de nombreux modèles et restent peu discriminants, car ces benchmarks sont plafonnés. Son principal avantage pratique réside dans son rapport entre contexte, poids ouverts et coût. Sa tarification se situe 98% sous la moyenne des LLM similaires et environ 114.2 fois sous celle des modèles frontière.
Limites et points d'attention. General Knowledge le place en retrait, à la 102e place sur 161, tandis qu’Email Classification le situe 135e sur 163. Dans Arena text, son rang 150 sur 200 le place derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Claude Fable 5 est nettement devant en duel. Le modèle reste pertinent pour les déploiements à budget serré, les traitements de longs contextes et les projets recherchant des poids ouverts. Pour un résultat plus abouti selon les préférences humaines de l’arène, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).