Qwen3-Coder 480B A35B Instruct

Qwen3-Coder 480B A35B Instruct est un LLM open-weights de Qwen, publié sous licence Apache 2.0 le 31 janvier 2025. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles plus récents.

Qwen3-Coder 480B A35B Instruct est un LLM open-weights de Qwen, publié sous licence Apache 2.0 le 31 janvier 2025. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles plus récents.

Son architecture à experts totalise 480 milliards de paramètres, dont 35 milliards actifs. Orienté vers le codage agentique, l’usage agentique du navigateur et l’appel d’outils, il accepte jusqu’à environ un million de tokens avec Yarn. Son accès gratuit le place 100 % sous le tarif moyen des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie31 janvier 2025
Multimodalnon
Paramètres480 milliards
Paramètres actifs35 milliards
Fenêtre de contexte1 048 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index18.0109ᵉ / 137
Math Index39.337ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
TAU-bench Retail77,5 %8ᵉ / 24llm-statsAuto-déclaré
SWE-Bench Verified69,6 %59ᵉ / 102llm-statsAuto-déclaré
BFCL-v368,7 %12ᵉ / 19llm-statsAuto-déclaré
Aider-Polyglot61,8 %11ᵉ / 22llm-statsAuto-déclaré
TAU-bench Airline60,0 %4ᵉ / 22llm-statsAuto-déclaré
MM-Mind2Web55,8 %3ᵉ / 3llm-statsAuto-déclaré
SWE-bench Multilingual54,7 %28ᵉ / 34llm-statsAuto-déclaré
Terminal-Bench 2.037,5 %47ᵉ / 49llm-statsAuto-déclaré
Multi-SWE-Bench25,8 %6ᵉ / 6llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nova 2.0 Pro Preview21.8
▶ Qwen3-Coder 480B A35B I…18.0

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ Qwen3-Coder 480B A35B I…39.3

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
142ᵉClaude Sonnet 41389
143ᵉo1-preview1388
144ᵉQwen3-Coder 480B A35B Instruct1388
145ᵉMiMo-V2-Flash1387
146ᵉClaude 3.7 Sonnet1387

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
80ᵉMiMo-V2-Flash1300
81ᵉDeepSeek-V3.2-Exp1288
82ᵉQwen3-Coder 480B A35B Instruct1281
83ᵉMistral Medium 3.51267
84ᵉKAT-Coder-Pro-V11259

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Venice (Beta)gratuitgratuitn.d.
Google Vertex0,22 $1,8 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.

Notre analyse

Forces. À sa sortie, Qwen3-Coder 480B A35B Instruct figurait dans le top 20 % des LLM de sa génération sur SWE-Bench Verified, un résultat solide pour les tâches de développement logiciel. Son Math Index reste mieux classé que ses résultats généraux. Sa grande fenêtre de contexte constitue un autre atout concret : le contexte natif atteint 262 144 tokens et peut être étendu à 1 048 576 tokens avec Yarn. Le modèle prend en charge le tool calling et un format d’appel de fonction spécialisé. Son architecture comporte 62 couches, 160 experts dont 8 activés, ainsi qu’une attention GQA avec 96 têtes de requête et 8 têtes clé-valeur.

Limites et points d’attention. Les classements actuels le situent dans le bas du tableau en intelligence générale, en Arena text et plus encore en Arena code. L’écart avec les modèles en tête est particulièrement marqué sur le code, malgré son positionnement spécialisé. Après environ un an, ses performances sont largement dépassées à l’échelle très rapide de l’IA, et les modèles de cette ancienneté sont souvent retirés des catalogues des éditeurs. Il fonctionne uniquement en mode non-thinking et ne produit pas de blocs de raisonnement explicites. Sa taille totale de 480 milliards de paramètres implique aussi une architecture particulièrement volumineuse, même si seuls 35 milliards sont activés à chaque traitement.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai).