Qwen: Qwen3 Coder 30B A3B Instruct
Qwen: Qwen3 Coder 30B A3B Instruct est un LLM à poids ouverts d’Alibaba Cloud et de la Qwen Team, sorti le 31 juillet 2025. Orienté vers le développement logiciel, il cible le codage agentique, l’usage agentique du navigateur et la compréhension de dépôts de code.
Qwen: Qwen3 Coder 30B A3B Instruct est un LLM à poids ouverts d’Alibaba Cloud et de la Qwen Team, sorti le 31 juillet 2025. Orienté vers le développement logiciel, il cible le codage agentique, l’usage agentique du navigateur et la compréhension de dépôts de code.
Son architecture compte 30,5 milliards de paramètres, dont 3,3 milliards activés, avec 128 experts dont 8 mobilisés. Le modèle propose une fenêtre de 160 000 tokens et des connaissances arrêtées au 30 juin 2025. Son tarif très économique se situe 97% sous la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 31 juillet 2025 |
| Connaissances jusqu'à | 2025-06-30 |
| Multimodal | non |
| Fenêtre de contexte | 160 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Keyword Topic Relevance Classification | 100,0 % | 1ᵉ / 6 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 98,0 % | 105ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 94,0 % | 78ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 91,0 % | 143ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 89,0 % | 78ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 89,0 % | 77ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 78,0 % | 76ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 51,5 % | 107ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 32,2 % | 149ᵉ / 161 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Keyword Topic Relevance Classification
Benchable : Ethics (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| NovitaAI | 0,07 $ | 0,27 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 97 % en dessous de la moyenne des LLM similaires, et 78,6 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 2 min 54 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Le modèle partage la première place de Keyword Topic Relevance Classification avec deux autres modèles, sur un benchmark plafonné qui départage peu les concurrents. Ses résultats en Coding et Mathematics se situent en milieu de tableau. Son architecture à experts réduit le nombre de paramètres activés à chaque traitement. Elle est optimisée pour travailler à l’échelle de dépôts et peut étendre le contexte jusqu’à 1M tokens avec Yarn. L’appel d’outils repose sur un format de function call adapté au codage agentique et à Agentic Browser-Use. Le prix constitue son principal avantage économique : il coûte environ 78,6 fois moins cher que les modèles frontière.
Limites et points d’attention. Les classements Benchable restent modestes malgré des scores bruts élevés. Le modèle se place dans la seconde moitié du classement en Ethics, au milieu en Hallucinations et près du bas du tableau en Email Classification. Ces benchmarks sont plafonnés et restent peu discriminants. Le modèle fonctionne uniquement en mode non-thinking et ne produit pas de blocs <think></think>. Il convient surtout aux projets de développement logiciel qui privilégient les poids ouverts, un long contexte, l’appel d’outils et un coût d’usage très faible.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).