Qwen: Qwen3 30B A3B Thinking 2507

Qwen: Qwen3 30B A3B Thinking 2507 est un LLM à poids ouverts d’Alibaba Cloud et de la Qwen Team, sorti le 28 août 2025. Son architecture Qwen3-MoE compte 30,5 milliards de paramètres, dont 3,3 milliards activés, avec 8 experts mobilisés parmi 128.

Qwen: Qwen3 30B A3B Thinking 2507 est un LLM à poids ouverts d’Alibaba Cloud et de la Qwen Team, sorti le 28 août 2025. Son architecture Qwen3-MoE compte 30,5 milliards de paramètres, dont 3,3 milliards activés, avec 8 experts mobilisés parmi 128.

Le modèle fonctionne exclusivement en mode thinking, avec l’ajout automatique de la balise <think> dans le template de chat. Son post-entraînement cible notamment le raisonnement, les mathématiques, le codage, le suivi d’instructions et l’usage d’outils. Ses connaissances s’arrêtent au 30 juin 2025 et son positionnement tarifaire est très économique.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts
Date de sortie28 août 2025
Connaissances jusqu'à2025-06-30
Multimodalnon
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)98,0 %16ᵉ / 155benchable✅ Mesuré
Benchable : Mathematics (Baseline)93,9 %43ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)92,9 %52ᵉ / 162benchable✅ Mesuré
Benchable : Keyword Topic Relevance Classification90,0 %4ᵉ / 6benchable✅ Mesuré
Benchable : Hallucinations (Baseline)84,0 %104ᵉ / 146benchable✅ Mesuré
Benchable : Instruction Following (Baseline)0,0 %145ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

▶ Qwen3 30B A3B Thi…100 %
command-r-plus-08-202499 %

Benchable : General Knowledge (Baseline)

▶ Qwen3 30B A3B Thi…100 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Alibaba Cloud Int.0,13 $1,56 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 94 % en dessous de la moyenne des LLM similaires, et 42,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,03 $
Latence moyenne par benchmark — Benchable16 min 22 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Reasoning constitue son résultat le plus solide, avec un score élevé et une place partagée dans le haut du classement. Email Classification atteint également un niveau élevé, mais de nombreux modèles obtiennent un résultat similaire. Les scores en Mathematics et Coding restent solides en valeur absolue. Le modèle prend aussi en charge la génération de texte, les sciences, l’usage d’outils et l’alignement avec les préférences humaines. Son contexte natif atteint 262 144 tokens et peut approcher 1 million de tokens avec Dual Chunk Attention et MInference après configuration spécifique. Son tarif se situe 94% sous la moyenne des LLM similaires et environ 42,3 fois sous celui des modèles frontière.

Limites et points d’attention. Les résultats parfaits en Ethics et General Knowledge sont peu discriminants, car ces benchmarks sont plafonnés et largement partagés. Mathematics se place au 43e rang sur 140, tandis que Coding partage le 52e rang sur 162. Ces classements nuancent les scores bruts élevés. La fenêtre de contexte proposée est de 131 072 tokens, et l’extension vers environ 1 million exige une configuration dédiée. Le fonctionnement exclusif en mode thinking écarte les usages qui nécessitent un mode de réponse distinct. Ce modèle convient surtout aux projets qui privilégient le raisonnement, le long contexte, les poids ouverts et un coût d’utilisation très bas.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).