Qwen2.5 32B Instruct
Publié par Qwen en septembre 2024, Qwen2.5 32B Instruct est désormais un LLM ancien à l’échelle de l’IA, proche de deux ans d’ancienneté. À sa sortie, il se situait dans le tiers supérieur des 35 modèles de sa génération évalués sur GPQA.
Publié par Qwen en septembre 2024, Qwen2.5 32B Instruct est désormais un LLM ancien à l’échelle de l’IA, proche de deux ans d’ancienneté. À sa sortie, il se situait dans le tiers supérieur des 35 modèles de sa génération évalués sur GPQA.
Ce modèle causal de 32,5 milliards de paramètres est spécialisé dans le suivi d’instructions, les textes longs et le traitement de données structurées, notamment en JSON. Sa fenêtre de contexte atteint 131 072 tokens et sa couverture dépasse 29 langues, dont le français. Ses poids ouverts sous licence Apache 2.0 autorisent l’usage commercial.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 19 septembre 2024 |
| Multimodal | non |
| Paramètres | 32 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| GSM8k | 95,9 % | 7ᵉ / 47 | llm-stats | Auto-déclaré |
| HumanEval | 88,4 % | 20ᵉ / 65 | llm-stats | Auto-déclaré |
| HellaSwag | 85,2 % | 13ᵉ / 27 | llm-stats | Auto-déclaré |
| BBH | 84,5 % | 4ᵉ / 12 | llm-stats | Auto-déclaré |
| MBPP | 84,0 % | 7ᵉ / 33 | llm-stats | Auto-déclaré |
| MMLU-Redux | 83,9 % | 35ᵉ / 48 | llm-stats | Auto-déclaré |
| MMLU | 83,3 % | 46ᵉ / 98 | llm-stats | Auto-déclaré |
| MATH | 83,1 % | 15ᵉ / 70 | llm-stats | Auto-déclaré |
| Winogrande | 82,0 % | 8ᵉ / 22 | llm-stats | Auto-déclaré |
| MultiPL-E | 75,4 % | 6ᵉ / 13 | llm-stats | Auto-déclaré |
| ARC-C | 70,4 % | 22ᵉ / 34 | llm-stats | Auto-déclaré |
| MMLU-Pro | 69,0 % | 82ᵉ / 125 | llm-stats | Auto-déclaré |
| MBPP+ | 67,2 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| TruthfulQA | 57,8 % | 11ᵉ / 18 | llm-stats | Auto-déclaré |
| HumanEval+ | 52,4 % | 8ᵉ / 10 | llm-stats | Auto-déclaré |
| GPQA | 49,5 % | 164ᵉ / 219 | llm-stats | Auto-déclaré |
| TheoremQA | 44,1 % | 2ᵉ / 6 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. Qwen2.5 32B Instruct affichait à sa sortie un positionnement solide en raisonnement scientifique sur GPQA, dans le tiers supérieur des LLM publiés au cours des quelque 18 mois précédents. Son post-entraînement cible le suivi d’instructions, la génération de textes longs ainsi que la compréhension et la production de données structurées. La génération de JSON constitue notamment un usage prévu. Sa fenêtre de 131 072 tokens favorise le traitement de contenus volumineux. Sa prise en charge de plus de 29 langues étend son champ d’utilisation au-delà du chinois et de l’anglais. L’architecture repose sur 64 couches de transformers, avec RoPE, SwiGLU, RMSNorm et attention GQA.
Limites et points d’attention. Près de deux ans après sa sortie, ses performances sont largement dépassées par celles des modèles plus récents, et les modèles de cette ancienneté sont souvent retirés des catalogues de leurs éditeurs. Son classement d’époque sur GPQA était bon sans le placer tout en haut de sa génération. Sa limite de connaissances au 30 juin 2024 exclut les événements ultérieurs. Enfin, ses 32,5 milliards de paramètres impliquent un modèle nettement plus lourd qu’un petit LLM, malgré les optimisations de son architecture.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).