Qwen2.5 7B Instruct
Publié par Qwen le 19 septembre 2024, Qwen2.5 7B Instruct est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Désormais ancien à l’échelle de l’IA, il appartient à une génération probablement dépassée et souvent retirée des catalogues.
Publié par Qwen le 19 septembre 2024, Qwen2.5 7B Instruct est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Désormais ancien à l’échelle de l’IA, il appartient à une génération probablement dépassée et souvent retirée des catalogues.
Ce modèle causal de 7,61 milliards de paramètres se distingue par une fenêtre de contexte de 131 072 tokens, une génération maximale de 8192 tokens et la prise en charge de plus de 29 langues. Son positionnement reste très économique, avec une tarification située 98 % sous la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 19 septembre 2024 |
| Multimodal | non |
| Paramètres | 8 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| GSM8k | 91,6 % | 21ᵉ / 47 | llm-stats | Auto-déclaré |
| MT-Bench | 87,5 % | 5ᵉ / 12 | llm-stats | Auto-déclaré |
| HumanEval | 84,8 % | 36ᵉ / 65 | llm-stats | Auto-déclaré |
| MBPP | 79,2 % | 14ᵉ / 33 | llm-stats | Auto-déclaré |
| MATH | 75,5 % | 28ᵉ / 70 | llm-stats | Auto-déclaré |
| MMLU-Redux | 75,4 % | 43ᵉ / 48 | llm-stats | Auto-déclaré |
| AlignBench | 73,3 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| IFEval | 71,2 % | 61ᵉ / 65 | llm-stats | Auto-déclaré |
| MultiPL-E | 70,4 % | 9ᵉ / 13 | llm-stats | Auto-déclaré |
| MMLU-Pro | 56,3 % | 103ᵉ / 125 | llm-stats | Auto-déclaré |
| Arena Hard | 52,0 % | 18ᵉ / 26 | llm-stats | Auto-déclaré |
| GPQA | 36,4 % | 197ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveBench | 35,9 % | 37ᵉ / 38 | llm-stats | Auto-déclaré |
| LiveCodeBench | 28,7 % | 62ᵉ / 72 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Phala | 0,04 $ | 0,1 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 98 % en dessous de la moyenne des LLM similaires, et 137,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 1 h 06 min |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Qwen2.5 7B Instruct obtient son résultat le plus solide sur Hallucinations, où il se place dans la première moitié du classement Benchable. Ses scores bruts restent également élevés en classification d’e-mails, en code et en mathématiques, même si leurs rangs relatifs sont moins favorables. À sa sortie, il appartenait au top 69 % des LLM de sa génération sur GPQA, soit un positionnement plutôt modeste pour son époque. Son architecture transformers combine RoPE, SwiGLU, RMSNorm et GQA, avec 28 couches, 28 têtes Q et 4 têtes KV. Le modèle est adapté au suivi d’instructions, aux textes longs, aux données structurées et aux sorties structurées, notamment en JSON. Son coût constitue un avantage net : il est environ 137,5 fois moins cher que les modèles frontière.
Limites et points d'attention. Malgré de bons scores bruts sur certaines tâches, les classements en classification d’e-mails, connaissances générales et éthique figurent près du bas des comparatifs. Le code et les mathématiques restent eux aussi dans la seconde moitié des classements. Avec près de deux ans d’ancienneté, ses performances sont aujourd’hui largement dépassées et le modèle est souvent retiré du catalogue de l’éditeur. Ses connaissances s’arrêtent au 30 juin 2024, ce qui limite sa pertinence sur les événements et informations ultérieurs.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).