Qwen2.5-32B
Qwen2.5-32B est un LLM chinois de 32 milliards de paramètres, publié par Qwen le 17 septembre 2024. Près de deux ans plus tard, il appartient à une génération déjà très ancienne à l’échelle de l’IA, probablement dépassée et souvent retirée des catalogues au profit de modèles plus récents.
Qwen2.5-32B est un LLM chinois de 32 milliards de paramètres, publié par Qwen le 17 septembre 2024. Près de deux ans plus tard, il appartient à une génération déjà très ancienne à l’échelle de l’IA, probablement dépassée et souvent retirée des catalogues au profit de modèles plus récents.
Son entraînement reste marquant par son ampleur : 3,5 × 10²⁴ FLOP, soit environ 975 000 heures-GPU H100. Cette charge équivaut à près de 450 GPU H100 fonctionnant sans interruption pendant trois mois, un investissement de calcul conséquent pour un modèle de cette période.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Qwen |
| Poids | ▫ n.d. |
| Date de sortie | 17 septembre 2024 |
| Paramètres | 32 milliards |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: MATH level 5 | 56,1 % | 24ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 46,1 % | 51ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 7,4 % | 42ᵉ / 64 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: MATH level 5
Epoch: GPQA diamond
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 3,5 × 10²⁴ FLOP |
| Taille du jeu d'entraînement | 1,8 × 10¹³ |
| Jeu de données | Unspecified unreleased |
| Pays | China |
Notre analyse
Forces. À sa sortie, Qwen2.5-32B se situait dans le top 26% des LLM de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. Ce résultat le plaçait dans la partie supérieure des 47 modèles publiés au cours des quelque 18 mois précédents. MATH level 5 constitue aujourd’hui son résultat comparatif le plus solide parmi les évaluations fournies, avec une position proche du milieu du classement. Ces performances témoignent d’un niveau alors compétitif sur le raisonnement scientifique et les problèmes mathématiques exigeants.
Limites et points d’attention. Les classements actuels montrent un net décrochage : Qwen2.5-32B apparaît dans la partie basse sur GPQA diamond et plus bas encore sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée. Ses performances sont désormais largement dépassées, et cette ancienne version est souvent absente du catalogue de l’éditeur. Son principal intérêt est donc historique : il illustre le niveau atteint en septembre 2024 avec 32 milliards de paramètres, au prix d’un entraînement de 3,5 × 10²⁴ FLOP, comparable à 450 GPU H100 mobilisés pendant trois mois.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.