Qwen2.5-72B

Qwen2.5-72B est un LLM de 73 milliards de paramètres publié par l’éditeur chinois Qwen le 19 septembre 2024. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles plus récents et souvent absente des catalogues…

Qwen2.5-72B est un LLM de 73 milliards de paramètres publié par l’éditeur chinois Qwen le 19 septembre 2024. Âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles plus récents et souvent absente des catalogues actuels.

À sa sortie, il se classait dans le top 17 % des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Son entraînement représente 7,8 × 10²⁴ FLOP, soit environ 2,2 millions d’heures-GPU H100, l’équivalent de 1 000 GPU H100 fonctionnant pendant trois mois.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurQwen
Poids▫ n.d.
Date de sortie19 septembre 2024
Paramètres73 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: MATH level 563,2 %21ᵉ / 59epoch✅ Mesuré
Epoch: GPQA diamond49,1 %43ᵉ / 85epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20258,1 %41ᵉ / 64epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: MATH level 5

GPT-598 %
▶ Qwen2.5-72B63 %

Epoch: GPQA diamond

▶ Qwen2.5-72B49 %
Tulu 346 %

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement7,8 × 10²⁴ FLOP
Taille du jeu d'entraînement1,8 × 10¹³
Jeu de donnéesUnspecified unreleased
PaysChina

Notre analyse

Forces. Qwen2.5-72B occupait à sa sortie une position élevée parmi les modèles de sa période sur GPQA diamond, avec une place dans le top 17 % de sa génération. Ce résultat signalait alors de solides performances sur des questions scientifiques de niveau doctorat. MATH level 5 constitue aujourd’hui son meilleur résultat parmi les évaluations fournies, avec un score de 63 % et une position dans la première moitié du classement. L’ampleur de l’entraînement reste également marquante : 7,8 × 10²⁴ FLOP, soit environ 2,2 millions d’heures-GPU H100.

Limites et points d’attention. Près de deux ans après sa sortie, Qwen2.5-72B est largement dépassé à l’échelle très rapide de l’IA et peut ne plus figurer au catalogue de son éditeur. Sa position actuelle sur GPQA diamond se situe dans la seconde moitié du classement, loin de son rang relatif à sa sortie. OTIS Mock AIME 2024-2025 révèle une faiblesse plus nette en mathématiques d’olympiade de niveau lycée : son score de 8 % le place dans le dernier quart du classement. Ces résultats limitent son intérêt face aux modèles haut de gamme plus récents.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.