Qwen2.5-Coder 32B Instruct
Qwen2.5-Coder 32B Instruct est un LLM de Qwen spécialisé dans la génération, le raisonnement et la correction de code. Sorti le 19 septembre 2024, il approche déjà deux ans, une ancienneté très importante dans l’IA. Ses connaissances s’arrêtent au 30 juin 2024.
Qwen2.5-Coder 32B Instruct est un LLM de Qwen spécialisé dans la génération, le raisonnement et la correction de code. Sorti le 19 septembre 2024, il approche déjà deux ans, une ancienneté très importante dans l’IA. Ses connaissances s’arrêtent au 30 juin 2024.
Le modèle combine 32 milliards de paramètres, une fenêtre de contexte de 128 000 tokens et une licence Apache 2.0 autorisant l’usage commercial. Son principal atout actuel réside dans son coût très économique, inférieur de 67% à la moyenne des LLM similaires, avec des poids ouverts qui facilitent son déploiement indépendant.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 19 septembre 2024 |
| Multimodal | non |
| Paramètres | 32 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| HumanEval | 92,7 % | 6ᵉ / 65 | llm-stats | Auto-déclaré |
| GSM8k | 91,1 % | 23ᵉ / 47 | llm-stats | Auto-déclaré |
| MBPP | 90,2 % | 3ᵉ / 33 | llm-stats | Auto-déclaré |
| HellaSwag | 83,0 % | 16ᵉ / 27 | llm-stats | Auto-déclaré |
| Winogrande | 80,8 % | 10ᵉ / 22 | llm-stats | Auto-déclaré |
| MMLU-Redux | 77,5 % | 42ᵉ / 48 | llm-stats | Auto-déclaré |
| MMLU | 75,1 % | 75ᵉ / 98 | llm-stats | Auto-déclaré |
| ARC-C | 70,5 % | 21ᵉ / 34 | llm-stats | Auto-déclaré |
| MATH | 57,2 % | 50ᵉ / 70 | llm-stats | Auto-déclaré |
| TruthfulQA | 54,2 % | 14ᵉ / 18 | llm-stats | Auto-déclaré |
| MMLU-Pro | 50,4 % | 111ᵉ / 125 | llm-stats | Auto-déclaré |
| TheoremQA | 43,1 % | 3ᵉ / 6 | llm-stats | Auto-déclaré |
| LiveCodeBench | 31,4 % | 59ᵉ / 72 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Cloudflare | 0,66 $ | 1 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 68 % en dessous de la moyenne des LLM similaires, et 8,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 2 min 39 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Qwen2.5-Coder 32B Instruct se distingue surtout sur Hallucinations (Baseline), où il occupe la première place parmi 234 modèles. Ses résultats en Ethics, General Knowledge et Email Classification affichent des scores bruts élevés, même si leurs classements relatifs sont moins favorables. Son architecture de type transformer repose notamment sur RoPE, SwiGLU et RMSNorm. Le contexte long convient au traitement de volumes importants de code, tandis que sa spécialisation couvre la génération, l’analyse et la correction. Son tarif constitue un avantage net : il coûte environ 8,3 fois moins cher que les modèles frontière.
Limites et points d'attention. Malgré son orientation code, Coding le place dans le bas du classement Benchable, tandis que Reasoning reste en milieu de tableau. Sur MATH, il appartenait seulement au top 56% des 36 LLM de sa génération lors de sa sortie, un positionnement déjà peu distinctif à l’époque. Près de deux ans plus tard, ses performances sont largement dépassées par des modèles plus récents, et ce type de version ancienne est souvent retiré du catalogue de l’éditeur. La limite de connaissances fixée à juin 2024 réduit aussi sa pertinence pour les langages, bibliothèques et pratiques apparus depuis.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).