Qwen: Qwen3 30B A3B Thinking 2507
Qwen: Qwen3 30B A3B Thinking 2507 est un LLM à poids ouverts d’Alibaba Cloud et de la Qwen Team, sorti le 28 août 2025. Son architecture Qwen3-MoE compte 30,5 milliards de paramètres, dont 3,3 milliards activés, avec 8 experts mobilisés parmi 128.
Qwen: Qwen3 30B A3B Thinking 2507 est un LLM à poids ouverts d’Alibaba Cloud et de la Qwen Team, sorti le 28 août 2025. Son architecture Qwen3-MoE compte 30,5 milliards de paramètres, dont 3,3 milliards activés, avec 8 experts mobilisés parmi 128.
Le modèle fonctionne exclusivement en mode thinking, avec l’ajout automatique de la balise <think> dans le template de chat. Son post-entraînement cible notamment le raisonnement, les mathématiques, le codage, le suivi d’instructions et l’usage d’outils. Ses connaissances s’arrêtent au 30 juin 2025 et son positionnement tarifaire est très économique.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 28 août 2025 |
| Connaissances jusqu'à | 2025-06-30 |
| Multimodal | non |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 98,0 % | 16ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 93,9 % | 43ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 92,9 % | 52ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Keyword Topic Relevance Classification | 90,0 % | 4ᵉ / 6 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 84,0 % | 104ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 0,0 % | 145ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Ethics (Baseline)
Benchable : General Knowledge (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Alibaba Cloud Int. | 0,13 $ | 1,56 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 94 % en dessous de la moyenne des LLM similaires, et 42,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,03 $ |
| Latence moyenne par benchmark — Benchable | 16 min 22 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Reasoning constitue son résultat le plus solide, avec un score élevé et une place partagée dans le haut du classement. Email Classification atteint également un niveau élevé, mais de nombreux modèles obtiennent un résultat similaire. Les scores en Mathematics et Coding restent solides en valeur absolue. Le modèle prend aussi en charge la génération de texte, les sciences, l’usage d’outils et l’alignement avec les préférences humaines. Son contexte natif atteint 262 144 tokens et peut approcher 1 million de tokens avec Dual Chunk Attention et MInference après configuration spécifique. Son tarif se situe 94% sous la moyenne des LLM similaires et environ 42,3 fois sous celui des modèles frontière.
Limites et points d’attention. Les résultats parfaits en Ethics et General Knowledge sont peu discriminants, car ces benchmarks sont plafonnés et largement partagés. Mathematics se place au 43e rang sur 140, tandis que Coding partage le 52e rang sur 162. Ces classements nuancent les scores bruts élevés. La fenêtre de contexte proposée est de 131 072 tokens, et l’extension vers environ 1 million exige une configuration dédiée. Le fonctionnement exclusif en mode thinking écarte les usages qui nécessitent un mode de réponse distinct. Ce modèle convient surtout aux projets qui privilégient le raisonnement, le long contexte, les poids ouverts et un coût d’utilisation très bas.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).