Qwen2.5 72B Instruct

Publié par Qwen le 19 septembre 2024, Qwen2.5 72B Instruct est désormais un LLM ancien à l’échelle de l’IA, probablement dépassé par les modèles récents. À sa sortie, il se classait néanmoins dans le top 37% des LLM de sa génération sur GPQA.

Publié par Qwen le 19 septembre 2024, Qwen2.5 72B Instruct est désormais un LLM ancien à l’échelle de l’IA, probablement dépassé par les modèles récents. À sa sortie, il se classait néanmoins dans le top 37% des LLM de sa génération sur GPQA.

Ce modèle open-weights de 73 milliards de paramètres autorise l’usage commercial. Il combine une fenêtre de contexte de 131 072 tokens, une génération atteignant 8192 tokens et la prise en charge de plus de 29 langues. Son tarif très économique se situe 82% sous la moyenne des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceQwen
Date de sortie19 septembre 2024
Multimodalnon
Paramètres73 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index9.6129ᵉ / 137
Math Index14.049ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
GSM8k95,8 %9ᵉ / 47llm-statsAuto-déclaré
MT-Bench93,5 %1ᵉ / 12llm-statsAuto-déclaré
MBPP88,2 %5ᵉ / 33llm-statsAuto-déclaré
MMLU-Redux86,8 %32ᵉ / 48llm-statsAuto-déclaré
HumanEval86,6 %30ᵉ / 65llm-statsAuto-déclaré
IFEval84,1 %41ᵉ / 65llm-statsAuto-déclaré
MATH83,1 %15ᵉ / 70llm-statsAuto-déclaré
AlignBench81,6 %1ᵉ / 4llm-statsAuto-déclaré
Arena Hard81,2 %6ᵉ / 26llm-statsAuto-déclaré
MultiPL-E75,1 %7ᵉ / 13llm-statsAuto-déclaré
MMLU-Pro71,1 %77ᵉ / 125llm-statsAuto-déclaré
LiveCodeBench55,5 %36ᵉ / 72llm-statsAuto-déclaré
LiveBench52,3 %34ᵉ / 38llm-statsAuto-déclaré
GPQA49,0 %166ᵉ / 219llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Qwen2.5 72B Instruct9.6

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ Qwen2.5 72B Instruct14.0

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,36 $0,4 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 83 % en dessous de la moyenne des LLM similaires, et 15,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable4 min 59 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement7,9 × 10²⁴ FLOP
Jeu de donnéesUnspecified unreleased
PaysChina

Notre analyse

Forces. Qwen2.5 72B Instruct obtient un résultat maximal et la première place ex æquo sur les évaluations Baseline consacrées aux hallucinations et à l’éthique. Ses scores sont également élevés en connaissances générales et en classification d’e-mails. Le code et les mathématiques restent solides en valeur absolue, malgré des classements moins favorables. Son architecture de 72,7 milliards de paramètres repose sur 80 couches et une attention GQA. Le modèle gère le suivi d’instructions, les textes longs, le code, les mathématiques, les données structurées et les sorties JSON. Son prix constitue un avantage net : il est environ 15,3 fois moins cher que les modèles frontière.

Limites et points d’attention. Près de deux ans après sa sortie, ses performances sont largement dépassées et ce type de modèle est souvent retiré du catalogue de son éditeur. L’Intelligence Index le place près du bas du classement, tandis que le Math Index et les rangs obtenus en code et en mathématiques confirment un retard marqué face aux références plus récentes. Son entraînement reste toutefois notable par son ampleur : 7,9 × 10²⁴ FLOP, soit environ 2,2 millions d’heures-GPU H100, l’équivalent d’environ 1 000 GPU H100 fonctionnant pendant trois mois. Ses connaissances s’arrêtent au 30 juin 2024.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).