qwen3-coder-next-2025-02-03

Publié le 4 février 2026 par Alibaba Cloud et la Qwen Team, qwen3-coder-next-2025-02-03 est un LLM chinois à poids ouverts spécialisé dans les agents de programmation et le développement local. Son architecture hybride de 48 couches associe Gated DeltaNet, attention à portes et mélange…

Publié le 4 février 2026 par Alibaba Cloud et la Qwen Team, qwen3-coder-next-2025-02-03 est un LLM chinois à poids ouverts spécialisé dans les agents de programmation et le développement local. Son architecture hybride de 48 couches associe Gated DeltaNet, attention à portes et mélange d’experts. Elle totalise 80 milliards de paramètres, dont 3 milliards sont activés.

Le modèle accepte 262 144 tokens de contexte et s’intègre aux environnements CLI, aux IDE et aux API compatibles OpenAI. Son positionnement tarifaire est très économique, à 95 % sous la moyenne des LLM similaires et environ 50 fois moins cher que les modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts
Date de sortie4 février 2026
Multimodalnon
Paramètres actifs3 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index21.198ᵉ / 137
Code Index36.252ᵉ / 74
Agentic Index8.853ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,0 %75ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)97,0 %100ᵉ / 163benchable✅ Mesuré
Benchable : Hallucinations (Baseline)94,0 %78ᵉ / 146benchable✅ Mesuré
Benchable : Mathematics (Baseline)90,7 %76ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)89,5 %76ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)79,6 %75ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)59,6 %92ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nova 2.0 Pro Preview21.8
▶ qwen3-coder-next-2025-0…21.1

Code Index

Qwen3.5 122B A10B43.3
▶ qwen3-coder-next-2025-0…36.2
Nova 2.0 Pro Preview34.0

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Ionstream0,11 $0,8 $0,07 $

Prix en dollars US par million de tokens.

Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 50 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,03 $
Latence moyenne par benchmark — Benchable53 min 42 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
PaysChina

Notre analyse

Forces. qwen3-coder-next-2025-02-03 prend en charge le raisonnement à long horizon, l’utilisation complexe d’outils et la récupération après un échec d’exécution. Ces fonctions correspondent directement aux besoins des agents de programmation. Coding (Baseline) le place dans la première moitié du classement, tandis que Mathematics (Baseline) se situe autour du milieu de tableau. La fenêtre de 262 144 tokens convient aux longues bases de code et aux tâches comportant de nombreuses étapes. L’activation de 3 milliards de paramètres sur un total de 80 milliards caractérise son architecture en mélange d’experts.

Limites et points d'attention. Les indices composites restent en retrait : Intelligence Index et Code Index figurent dans le dernier tiers de leurs classements, tandis qu’Agentic Index se situe dans le dernier quart. Les résultats élevés sur Ethics, General Knowledge, Email Classification et Hallucinations proviennent de benchmarks plafonnés et peu discriminants. Sur Ethics, le modèle partage notamment la première place avec 71 autres modèles. Il fonctionne uniquement en mode non-thinking et ne produit pas de blocs <think></think>. Il reste surtout pertinent pour des agents de code locaux, à longue fenêtre de contexte et soumis à de fortes contraintes de coût.


Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).