Qwen2.5 7B Instruct

Publié par Qwen le 19 septembre 2024, Qwen2.5 7B Instruct est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Désormais ancien à l’échelle de l’IA, il appartient à une génération probablement dépassée et souvent retirée des catalogues.

Publié par Qwen le 19 septembre 2024, Qwen2.5 7B Instruct est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Désormais ancien à l’échelle de l’IA, il appartient à une génération probablement dépassée et souvent retirée des catalogues.

Ce modèle causal de 7,61 milliards de paramètres se distingue par une fenêtre de contexte de 131 072 tokens, une génération maximale de 8192 tokens et la prise en charge de plus de 29 langues. Son positionnement reste très économique, avec une tarification située 98 % sous la moyenne des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie19 septembre 2024
Multimodalnon
Paramètres8 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
GSM8k91,6 %21ᵉ / 47llm-statsAuto-déclaré
MT-Bench87,5 %5ᵉ / 12llm-statsAuto-déclaré
HumanEval84,8 %36ᵉ / 65llm-statsAuto-déclaré
MBPP79,2 %14ᵉ / 33llm-statsAuto-déclaré
MATH75,5 %28ᵉ / 70llm-statsAuto-déclaré
MMLU-Redux75,4 %43ᵉ / 48llm-statsAuto-déclaré
AlignBench73,3 %3ᵉ / 4llm-statsAuto-déclaré
IFEval71,2 %61ᵉ / 65llm-statsAuto-déclaré
MultiPL-E70,4 %9ᵉ / 13llm-statsAuto-déclaré
MMLU-Pro56,3 %103ᵉ / 125llm-statsAuto-déclaré
Arena Hard52,0 %18ᵉ / 26llm-statsAuto-déclaré
GPQA36,4 %197ᵉ / 219llm-statsAuto-déclaré
LiveBench35,9 %37ᵉ / 38llm-statsAuto-déclaré
LiveCodeBench28,7 %62ᵉ / 72llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Phala0,04 $0,1 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 98 % en dessous de la moyenne des LLM similaires, et 137,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0 $
Latence moyenne par benchmark — Benchable1 h 06 min

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Qwen2.5 7B Instruct obtient son résultat le plus solide sur Hallucinations, où il se place dans la première moitié du classement Benchable. Ses scores bruts restent également élevés en classification d’e-mails, en code et en mathématiques, même si leurs rangs relatifs sont moins favorables. À sa sortie, il appartenait au top 69 % des LLM de sa génération sur GPQA, soit un positionnement plutôt modeste pour son époque. Son architecture transformers combine RoPE, SwiGLU, RMSNorm et GQA, avec 28 couches, 28 têtes Q et 4 têtes KV. Le modèle est adapté au suivi d’instructions, aux textes longs, aux données structurées et aux sorties structurées, notamment en JSON. Son coût constitue un avantage net : il est environ 137,5 fois moins cher que les modèles frontière.

Limites et points d'attention. Malgré de bons scores bruts sur certaines tâches, les classements en classification d’e-mails, connaissances générales et éthique figurent près du bas des comparatifs. Le code et les mathématiques restent eux aussi dans la seconde moitié des classements. Avec près de deux ans d’ancienneté, ses performances sont aujourd’hui largement dépassées et le modèle est souvent retiré du catalogue de l’éditeur. Ses connaissances s’arrêtent au 30 juin 2024, ce qui limite sa pertinence sur les événements et informations ultérieurs.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).