Qwen2.5-72B
Qwen2.5-72B est un LLM de 73 milliards de paramètres publié par l’éditeur chinois Qwen le 19 septembre 2024. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles plus récents et souvent absente des catalogues…
Qwen2.5-72B est un LLM de 73 milliards de paramètres publié par l’éditeur chinois Qwen le 19 septembre 2024. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles plus récents et souvent absente des catalogues actuels.
À sa sortie, il se classait dans le top 17 % des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Son entraînement représente 7,8 × 10²⁴ FLOP, soit environ 2,2 millions d’heures-GPU H100, l’équivalent de 1 000 GPU H100 fonctionnant pendant trois mois.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Qwen |
| Poids | ▫ n.d. |
| Date de sortie | 19 septembre 2024 |
| Paramètres | 73 milliards |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: MATH level 5 | 63,2 % | 21ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 49,1 % | 43ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 8,1 % | 41ᵉ / 64 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: MATH level 5
Epoch: GPQA diamond
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 7,8 × 10²⁴ FLOP |
| Taille du jeu d'entraînement | 1,8 × 10¹³ |
| Jeu de données | Unspecified unreleased |
| Pays | China |
Notre analyse
Forces. Qwen2.5-72B occupait à sa sortie une position élevée parmi les modèles de sa période sur GPQA diamond, avec une place dans le top 17 % de sa génération. Ce résultat signalait alors de solides performances sur des questions scientifiques de niveau doctorat. MATH level 5 constitue aujourd’hui son meilleur résultat parmi les évaluations fournies, avec un score de 63 % et une position dans la première moitié du classement. L’ampleur de l’entraînement reste également marquante : 7,8 × 10²⁴ FLOP, soit environ 2,2 millions d’heures-GPU H100.
Limites et points d’attention. Près de deux ans après sa sortie, Qwen2.5-72B est largement dépassé à l’échelle très rapide de l’IA et peut ne plus figurer au catalogue de son éditeur. Sa position actuelle sur GPQA diamond se situe dans la seconde moitié du classement, loin de son rang relatif à sa sortie. OTIS Mock AIME 2024-2025 révèle une faiblesse plus nette en mathématiques d’olympiade de niveau lycée : son score de 8 % le place dans le dernier quart du classement. Ces résultats limitent son intérêt face aux modèles haut de gamme plus récents.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.