qwen3-coder-next-2025-02-03
Publié le 4 février 2026 par Alibaba Cloud et la Qwen Team, qwen3-coder-next-2025-02-03 est un LLM chinois à poids ouverts spécialisé dans les agents de programmation et le développement local. Son architecture hybride de 48 couches associe Gated DeltaNet, attention à portes et mélange…
Publié le 4 février 2026 par Alibaba Cloud et la Qwen Team, qwen3-coder-next-2025-02-03 est un LLM chinois à poids ouverts spécialisé dans les agents de programmation et le développement local. Son architecture hybride de 48 couches associe Gated DeltaNet, attention à portes et mélange d’experts. Elle totalise 80 milliards de paramètres, dont 3 milliards sont activés.
Le modèle accepte 262 144 tokens de contexte et s’intègre aux environnements CLI, aux IDE et aux API compatibles OpenAI. Son positionnement tarifaire est très économique, à 95 % sous la moyenne des LLM similaires et environ 50 fois moins cher que les modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 4 février 2026 |
| Multimodal | non |
| Paramètres actifs | 3 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 21.1 | 98ᵉ / 137 |
| Code Index | 36.2 | 52ᵉ / 74 |
| Agentic Index | 8.8 | 53ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,0 % | 75ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 97,0 % | 100ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 94,0 % | 78ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 90,7 % | 76ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 89,5 % | 76ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 79,6 % | 75ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 59,6 % | 92ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Ionstream | 0,11 $ | 0,8 $ | 0,07 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 50 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,03 $ |
| Latence moyenne par benchmark — Benchable | 53 min 42 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | China |
Notre analyse
Forces. qwen3-coder-next-2025-02-03 prend en charge le raisonnement à long horizon, l’utilisation complexe d’outils et la récupération après un échec d’exécution. Ces fonctions correspondent directement aux besoins des agents de programmation. Coding (Baseline) le place dans la première moitié du classement, tandis que Mathematics (Baseline) se situe autour du milieu de tableau. La fenêtre de 262 144 tokens convient aux longues bases de code et aux tâches comportant de nombreuses étapes. L’activation de 3 milliards de paramètres sur un total de 80 milliards caractérise son architecture en mélange d’experts.
Limites et points d'attention. Les indices composites restent en retrait : Intelligence Index et Code Index figurent dans le dernier tiers de leurs classements, tandis qu’Agentic Index se situe dans le dernier quart. Les résultats élevés sur Ethics, General Knowledge, Email Classification et Hallucinations proviennent de benchmarks plafonnés et peu discriminants. Sur Ethics, le modèle partage notamment la première place avec 71 autres modèles. Il fonctionne uniquement en mode non-thinking et ne produit pas de blocs <think></think>. Il reste surtout pertinent pour des agents de code locaux, à longue fenêtre de contexte et soumis à de fortes contraintes de coût.
Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).