Qwen: Qwen3 30B A3B Instruct 2507

Publié le 29 juillet 2025 par Alibaba Cloud et la Qwen Team, Qwen3 30B A3B Instruct 2507 est un LLM à poids ouverts. Cette architecture Qwen3-MoE compte 30.5 milliards de paramètres, dont 3.3 milliards activés, avec 128 experts et 8 experts mobilisés. Elle fonctionne uniquement en mode…

Publié le 29 juillet 2025 par Alibaba Cloud et la Qwen Team, Qwen3 30B A3B Instruct 2507 est un LLM à poids ouverts. Cette architecture Qwen3-MoE compte 30.5 milliards de paramètres, dont 3.3 milliards activés, avec 128 experts et 8 experts mobilisés. Elle fonctionne uniquement en mode non-thinking.

Le modèle couvre plusieurs langues et des connaissances de longue traîne arrêtées au 30 juin 2025. Son contexte natif atteint 262 144 tokens, avec une configuration étendue jusqu’à environ 1 million de tokens via Dual Chunk Attention et MInference. Transformers, SGLang, vLLM et les endpoints compatibles OpenAI font partie des options d’utilisation et de déploiement.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts
Date de sortie29 juillet 2025
Connaissances jusqu'à2025-06-30
Multimodalnon
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Keyword Topic Relevance Classification100,0 %1ᵉ / 6benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : Hallucinations (Baseline)98,0 %47ᵉ / 146benchable✅ Mesuré
Benchable : General Knowledge (Baseline)97,0 %102ᵉ / 161benchable✅ Mesuré
Benchable : Mathematics (Baseline)94,0 %30ᵉ / 140benchable✅ Mesuré
Benchable : Email Classification (Baseline)94,0 %135ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)93,0 %42ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)78,0 %76ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)59,8 %91ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Keyword Topic Relevance Classification

▶ Qwen3 30B A3B Ins…100 %

Benchable : Ethics (Baseline)

▶ Qwen3 30B A3B Ins…100 %
command-r-plus-08-202499 %

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
148ᵉmistral-medium-25051387
149ᵉminimax-m2.1-preview1384
150ᵉQwen: Qwen3 30B A3B Instruct 25071383
151ᵉGPT-4.1 mini1383
152ᵉHunyuan-TurboS1382

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
StreamLake0,04815 $0,19305 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 98 % en dessous de la moyenne des LLM similaires, et 114,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable3 min 16 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Le modèle obtient son classement Benchable le plus solide sur Mathematics, où il partage la 30e place sur 140. Il se classe aussi 47e sur 146 dans Hallucinations. Ses scores parfaits en Keyword Topic Relevance Classification et Ethics sont partagés avec de nombreux modèles et restent peu discriminants, car ces benchmarks sont plafonnés. Son principal avantage pratique réside dans son rapport entre contexte, poids ouverts et coût. Sa tarification se situe 98% sous la moyenne des LLM similaires et environ 114.2 fois sous celle des modèles frontière.

Limites et points d'attention. General Knowledge le place en retrait, à la 102e place sur 161, tandis qu’Email Classification le situe 135e sur 163. Dans Arena text, son rang 150 sur 200 le place derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Claude Fable 5 est nettement devant en duel. Le modèle reste pertinent pour les déploiements à budget serré, les traitements de longs contextes et les projets recherchant des poids ouverts. Pour un résultat plus abouti selon les préférences humaines de l’arène, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.


Sources des données : OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).