Qwen2.5 32B Instruct

Publié par Qwen en septembre 2024, Qwen2.5 32B Instruct est désormais un LLM ancien à l’échelle de l’IA, proche de deux ans d’ancienneté. À sa sortie, il se situait dans le tiers supérieur des 35 modèles de sa génération évalués sur GPQA.

Publié par Qwen en septembre 2024, Qwen2.5 32B Instruct est désormais un LLM ancien à l’échelle de l’IA, proche de deux ans d’ancienneté. À sa sortie, il se situait dans le tiers supérieur des 35 modèles de sa génération évalués sur GPQA.

Ce modèle causal de 32,5 milliards de paramètres est spécialisé dans le suivi d’instructions, les textes longs et le traitement de données structurées, notamment en JSON. Sa fenêtre de contexte atteint 131 072 tokens et sa couverture dépasse 29 langues, dont le français. Ses poids ouverts sous licence Apache 2.0 autorisent l’usage commercial.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie19 septembre 2024
Multimodalnon
Paramètres32 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
GSM8k95,9 %7ᵉ / 47llm-statsAuto-déclaré
HumanEval88,4 %20ᵉ / 65llm-statsAuto-déclaré
HellaSwag85,2 %13ᵉ / 27llm-statsAuto-déclaré
BBH84,5 %4ᵉ / 12llm-statsAuto-déclaré
MBPP84,0 %7ᵉ / 33llm-statsAuto-déclaré
MMLU-Redux83,9 %35ᵉ / 48llm-statsAuto-déclaré
MMLU83,3 %46ᵉ / 98llm-statsAuto-déclaré
MATH83,1 %15ᵉ / 70llm-statsAuto-déclaré
Winogrande82,0 %8ᵉ / 22llm-statsAuto-déclaré
MultiPL-E75,4 %6ᵉ / 13llm-statsAuto-déclaré
ARC-C70,4 %22ᵉ / 34llm-statsAuto-déclaré
MMLU-Pro69,0 %82ᵉ / 125llm-statsAuto-déclaré
MBPP+67,2 %2ᵉ / 4llm-statsAuto-déclaré
TruthfulQA57,8 %11ᵉ / 18llm-statsAuto-déclaré
HumanEval+52,4 %8ᵉ / 10llm-statsAuto-déclaré
GPQA49,5 %164ᵉ / 219llm-statsAuto-déclaré
TheoremQA44,1 %2ᵉ / 6llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. Qwen2.5 32B Instruct affichait à sa sortie un positionnement solide en raisonnement scientifique sur GPQA, dans le tiers supérieur des LLM publiés au cours des quelque 18 mois précédents. Son post-entraînement cible le suivi d’instructions, la génération de textes longs ainsi que la compréhension et la production de données structurées. La génération de JSON constitue notamment un usage prévu. Sa fenêtre de 131 072 tokens favorise le traitement de contenus volumineux. Sa prise en charge de plus de 29 langues étend son champ d’utilisation au-delà du chinois et de l’anglais. L’architecture repose sur 64 couches de transformers, avec RoPE, SwiGLU, RMSNorm et attention GQA.

Limites et points d’attention. Près de deux ans après sa sortie, ses performances sont largement dépassées par celles des modèles plus récents, et les modèles de cette ancienneté sont souvent retirés des catalogues de leurs éditeurs. Son classement d’époque sur GPQA était bon sans le placer tout en haut de sa génération. Sa limite de connaissances au 30 juin 2024 exclut les événements ultérieurs. Enfin, ses 32,5 milliards de paramètres impliquent un modèle nettement plus lourd qu’un petit LLM, malgré les optimisations de son architecture.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).