qwen3-coder-480b-a35b-07-25

qwen3-coder-480b-a35b-07-25 est un LLM édité par Alibaba Cloud et la Qwen Team. Son évaluation couvre la classification de textes, le code, le raisonnement, les mathématiques et le suivi d’instructions.

qwen3-coder-480b-a35b-07-25 est un LLM édité par Alibaba Cloud et la Qwen Team. Son évaluation couvre la classification de textes, le code, le raisonnement, les mathématiques et le suivi d’instructions.

Le modèle obtient ses résultats bruts les plus élevés en classification d’e-mails, en pertinence thématique et en code. Ces scores ne suffisent toutefois pas à le distinguer, car les benchmarks concernés sont plafonnés. Son positionnement relatif est plus favorable en raisonnement et en suivi d’instructions qu’en mathématiques.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids▫ n.d.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Keyword Topic Relevance Classification90,0 %4ᵉ / 6benchable✅ Mesuré
Benchable : Coding (Baseline)88,0 %83ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)83,3 %66ᵉ / 155benchable✅ Mesuré
Benchable : Mathematics (Baseline)77,8 %106ᵉ / 140benchable✅ Mesuré
Benchable : Instruction Following (Baseline)65,4 %68ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
skyfall-36b-v298 %
▶ qwen3-coder-480b-a35b-0…98 %

Benchable : Keyword Topic Relevance Classification

▶ qwen3-coder-480b-a35b-0…90 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable11 min 52 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Email Classification constitue le résultat brut le plus élevé du modèle, avec 98 %. Keyword Topic Relevance Classification atteint également 90 %. En Coding, le score de 88 % montre une bonne réussite sur les tâches du benchmark. Sur les évaluations plus discriminantes, qwen3-coder-480b-a35b-07-25 se place dans la première moitié du classement en Reasoning et en Instruction Following. Le raisonnement forme ainsi l’un de ses résultats comparatifs les plus solides.

Limites et points d'attention. Les trois meilleurs scores bruts doivent être relativisés. En Email Classification, le modèle partage la 55e place avec 42 autres modèles. En Keyword Topic Relevance Classification, il partage la 4e place sur six avec deux concurrents. En Coding, il partage la 83e place sur 162 avec trois autres modèles. Ces benchmarks plafonnés sont peu discriminants. Mathematics constitue la faiblesse la plus nette, avec une 106e place sur 140. Instruction Following reste dans la première moitié du classement, mais son score de 65 % révèle une marge d’amélioration importante. Reasoning atteint 83 %, sans placer le modèle parmi les mieux classés.


Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).