qwen2.5-max

Publié le 25 janvier 2025, qwen2.5-max est un LLM de Qwen désormais ancien à l’échelle de l’IA. Environ un an après sa sortie, il appartient déjà à une génération dont les performances sont largement dépassées, et les modèles de cet âge ont souvent quitté le catalogue de leur éditeur.

Publié le 25 janvier 2025, qwen2.5-max est un LLM de Qwen désormais ancien à l’échelle de l’IA. Environ un an après sa sortie, il appartient déjà à une génération dont les performances sont largement dépassées, et les modèles de cet âge ont souvent quitté le catalogue de leur éditeur.

À sa sortie, qwen2.5-max figurait dans le top 13% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Ce classement le situait alors dans le haut du panier et constitue aujourd’hui son principal intérêt pour retracer l’évolution rapide des modèles généralistes.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurQwen
Poids▫ n.d.
Date de sortie25 janvier 2025

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: MATH level 567,2 %19ᵉ / 59epoch✅ Mesuré
Epoch: GPQA diamond56,1 %39ᵉ / 85epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-202516,1 %38ᵉ / 64epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private1,0 %28ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public0,0 %17ᵉ / 33epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: MATH level 5

GPT-598 %
▶ qwen2.5-max67 %

Epoch: GPQA diamond

▶ qwen2.5-max56 %

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
156ᵉQwen3 235B A22B1375
157ᵉgemini-2.5-flash-lite-preview-06-17-thinking1374
158ᵉqwen2.5-max1374
159ᵉGLM-4.5-Air1373
160ᵉClaude 3.5 Sonnet1373

Notre analyse

Forces. À sa sortie, qwen2.5-max se distinguait surtout sur GPQA diamond, où il appartenait au top 13% des LLM publiés au cours des 18 mois précédents. Sur MATH level 5, il atteint 67% et se place dans le premier tiers du panel évalué. Ces résultats montrent un niveau alors solide sur les questions scientifiques avancées et certains problèmes mathématiques.

Limites et points d’attention. Son classement actuel confirme son vieillissement. Il se situe dans la seconde moitié du panel sur GPQA diamond et OTIS Mock AIME 2024-2025. Sur FrontierMath, consacré aux mathématiques de recherche très difficiles, ses scores de 1% en privé et 0% en public restent des résultats planchers peu discriminants. Dans l’Arena text, il occupe le 158e rang sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant en duel. qwen2.5-max conserve surtout un intérêt comme point de comparaison historique pour les LLM du début de 2025. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.


Sources des données : Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.