Qwen2.5 72B Instruct
Publié par Qwen le 19 septembre 2024, Qwen2.5 72B Instruct est désormais un LLM ancien à l’échelle de l’IA, probablement dépassé par les modèles récents. À sa sortie, il se classait néanmoins dans le top 37% des LLM de sa génération sur GPQA.
Publié par Qwen le 19 septembre 2024, Qwen2.5 72B Instruct est désormais un LLM ancien à l’échelle de l’IA, probablement dépassé par les modèles récents. À sa sortie, il se classait néanmoins dans le top 37% des LLM de sa génération sur GPQA.
Ce modèle open-weights de 73 milliards de paramètres autorise l’usage commercial. Il combine une fenêtre de contexte de 131 072 tokens, une génération atteignant 8192 tokens et la prise en charge de plus de 29 langues. Son tarif très économique se situe 82% sous la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Qwen |
| Date de sortie | 19 septembre 2024 |
| Multimodal | non |
| Paramètres | 73 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 9.6 | 129ᵉ / 137 |
| Math Index | 14.0 | 49ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| GSM8k | 95,8 % | 9ᵉ / 47 | llm-stats | Auto-déclaré |
| MT-Bench | 93,5 % | 1ᵉ / 12 | llm-stats | Auto-déclaré |
| MBPP | 88,2 % | 5ᵉ / 33 | llm-stats | Auto-déclaré |
| MMLU-Redux | 86,8 % | 32ᵉ / 48 | llm-stats | Auto-déclaré |
| HumanEval | 86,6 % | 30ᵉ / 65 | llm-stats | Auto-déclaré |
| IFEval | 84,1 % | 41ᵉ / 65 | llm-stats | Auto-déclaré |
| MATH | 83,1 % | 15ᵉ / 70 | llm-stats | Auto-déclaré |
| AlignBench | 81,6 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| Arena Hard | 81,2 % | 6ᵉ / 26 | llm-stats | Auto-déclaré |
| MultiPL-E | 75,1 % | 7ᵉ / 13 | llm-stats | Auto-déclaré |
| MMLU-Pro | 71,1 % | 77ᵉ / 125 | llm-stats | Auto-déclaré |
| LiveCodeBench | 55,5 % | 36ᵉ / 72 | llm-stats | Auto-déclaré |
| LiveBench | 52,3 % | 34ᵉ / 38 | llm-stats | Auto-déclaré |
| GPQA | 49,0 % | 166ᵉ / 219 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,36 $ | 0,4 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 83 % en dessous de la moyenne des LLM similaires, et 15,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 4 min 59 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 7,9 × 10²⁴ FLOP |
| Jeu de données | Unspecified unreleased |
| Pays | China |
Notre analyse
Forces. Qwen2.5 72B Instruct obtient un résultat maximal et la première place ex æquo sur les évaluations Baseline consacrées aux hallucinations et à l’éthique. Ses scores sont également élevés en connaissances générales et en classification d’e-mails. Le code et les mathématiques restent solides en valeur absolue, malgré des classements moins favorables. Son architecture de 72,7 milliards de paramètres repose sur 80 couches et une attention GQA. Le modèle gère le suivi d’instructions, les textes longs, le code, les mathématiques, les données structurées et les sorties JSON. Son prix constitue un avantage net : il est environ 15,3 fois moins cher que les modèles frontière.
Limites et points d’attention. Près de deux ans après sa sortie, ses performances sont largement dépassées et ce type de modèle est souvent retiré du catalogue de son éditeur. L’Intelligence Index le place près du bas du classement, tandis que le Math Index et les rangs obtenus en code et en mathématiques confirment un retard marqué face aux références plus récentes. Son entraînement reste toutefois notable par son ampleur : 7,9 × 10²⁴ FLOP, soit environ 2,2 millions d’heures-GPU H100, l’équivalent d’environ 1 000 GPU H100 fonctionnant pendant trois mois. Ses connaissances s’arrêtent au 30 juin 2024.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).