qwen2.5-max
Publié le 25 janvier 2025, qwen2.5-max est un LLM de Qwen désormais ancien à l’échelle de l’IA. Environ un an après sa sortie, il appartient déjà à une génération dont les performances sont largement dépassées, et les modèles de cet âge ont souvent quitté le catalogue de leur éditeur.
Publié le 25 janvier 2025, qwen2.5-max est un LLM de Qwen désormais ancien à l’échelle de l’IA. Environ un an après sa sortie, il appartient déjà à une génération dont les performances sont largement dépassées, et les modèles de cet âge ont souvent quitté le catalogue de leur éditeur.
À sa sortie, qwen2.5-max figurait dans le top 13% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Ce classement le situait alors dans le haut du panier et constitue aujourd’hui son principal intérêt pour retracer l’évolution rapide des modèles généralistes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Qwen |
| Poids | ▫ n.d. |
| Date de sortie | 25 janvier 2025 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: MATH level 5 | 67,2 % | 19ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 56,1 % | 39ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 16,1 % | 38ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 1,0 % | 28ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 0,0 % | 17ᵉ / 33 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: MATH level 5
Epoch: GPQA diamond
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 156ᵉ | Qwen3 235B A22B | 1375 |
| 157ᵉ | gemini-2.5-flash-lite-preview-06-17-thinking | 1374 |
| 158ᵉ | qwen2.5-max | 1374 |
| 159ᵉ | GLM-4.5-Air | 1373 |
| 160ᵉ | Claude 3.5 Sonnet | 1373 |
Notre analyse
Forces. À sa sortie, qwen2.5-max se distinguait surtout sur GPQA diamond, où il appartenait au top 13% des LLM publiés au cours des 18 mois précédents. Sur MATH level 5, il atteint 67% et se place dans le premier tiers du panel évalué. Ces résultats montrent un niveau alors solide sur les questions scientifiques avancées et certains problèmes mathématiques.
Limites et points d’attention. Son classement actuel confirme son vieillissement. Il se situe dans la seconde moitié du panel sur GPQA diamond et OTIS Mock AIME 2024-2025. Sur FrontierMath, consacré aux mathématiques de recherche très difficiles, ses scores de 1% en privé et 0% en public restent des résultats planchers peu discriminants. Dans l’Arena text, il occupe le 158e rang sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant en duel. qwen2.5-max conserve surtout un intérêt comme point de comparaison historique pour les LLM du début de 2025. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.