QwQ-32B

QwQ-32B est un LLM causal de 32 milliards de paramètres publié par Qwen le 5 mars 2025. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles plus récents et souvent retirée des catalogues.

QwQ-32B est un LLM causal de 32 milliards de paramètres publié par Qwen le 5 mars 2025. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles plus récents et souvent retirée des catalogues.

Conçu pour le raisonnement, il combine pré-entraînement, supervised finetuning et reinforcement learning. Son entraînement représente 3,5 × 10²⁴ FLOP, soit environ 975 000 heures-GPU H100 ou 450 GPU H100 pendant trois mois. Sa licence Apache 2.0 autorise l’usage commercial de ses poids ouverts.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie5 mars 2025
Connaissances jusqu'à2024-11-28
Multimodalnon
Paramètres32 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MATH-50090,6 %24ᵉ / 31llm-statsAuto-déclaré
IFEval83,9 %43ᵉ / 65llm-statsAuto-déclaré
AIME 202479,5 %30ᵉ / 52llm-statsAuto-déclaré
LiveBench73,1 %22ᵉ / 38llm-statsAuto-déclaré
BFCL66,4 %10ᵉ / 11llm-statsAuto-déclaré
GPQA65,2 %136ᵉ / 219llm-statsAuto-déclaré
LiveCodeBench63,4 %29ᵉ / 72llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement3,5 × 10²⁴ FLOP
Jeu de donnéesUnspecified unreleased
PaysChina

Notre analyse

Forces. À sa sortie, QwQ-32B se classait dans le top 24% des 75 LLM de sa génération sur GPQA, un benchmark centré sur des questions scientifiques complexes. Ce résultat le situait dans le haut du panier de son époque pour le raisonnement évalué par ce test. Sa fenêtre de contexte de 131 072 tokens constitue une autre caractéristique notable. Son architecture transformer associe RoPE, SwiGLU, RMSNorm et un biais Attention QKV. Pour les prompts dépassant 8 192 tokens, YaRN doit être activé. L’intégration repose notamment sur transformers et apply_chat_template.

Limites et points d’attention. Son ancienneté pèse fortement sur sa pertinence actuelle. Dans Arena text, QwQ-32B occupe l’avant-dernière place parmi 200 modèles, très loin du modèle en tête, ce qui indique des performances conversationnelles aujourd’hui largement dépassées. Il est aussi souvent retiré du catalogue de son éditeur à ce stade de son cycle de vie. L’effort d’entraînement reste néanmoins marquant : environ 975 000 heures-GPU H100, soit l’équivalent de 450 GPU H100 fonctionnant pendant trois mois. Ses connaissances s’arrêtent au 28 novembre 2024.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.