Qwen3.5-9B
Publié par Qwen le 2 mars 2026, Qwen3.5-9B est un modèle de langage causal de 9 milliards de paramètres, complété par un encodeur vision. Il prend en charge 201 langues et dialectes, ainsi que des usages de raisonnement, de codage, d’agents et de compréhension visuelle.
Publié par Qwen le 2 mars 2026, Qwen3.5-9B est un modèle de langage causal de 9 milliards de paramètres, complété par un encodeur vision. Il prend en charge 201 langues et dialectes, ainsi que des usages de raisonnement, de codage, d’agents et de compréhension visuelle.
Son contexte natif atteint 262 144 tokens et peut être étendu jusqu’à 1 010 000 tokens. Distribué sous licence Apache 2.0 avec usage commercial autorisé, il fournit ses poids au format Hugging Face Transformers et fonctionne avec Transformers, vLLM, SGLang et KTransformers. Son tarif très économique constitue un autre trait distinctif.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 2 mars 2026 |
| Multimodal | oui |
| Paramètres | 9 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,image,video → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| IFEval | 91,5 % | 12ᵉ / 65 | llm-stats | Auto-déclaré |
| MMLU-Redux | 91,1 % | 22ᵉ / 48 | llm-stats | Auto-déclaré |
| C-Eval | 88,2 % | 11ᵉ / 18 | llm-stats | Auto-déclaré |
| MAXIFE | 83,4 % | 8ᵉ / 11 | llm-stats | Auto-déclaré |
| Global PIQA | 83,2 % | 10ᵉ / 13 | llm-stats | Auto-déclaré |
| HMMT 2025 | 83,2 % | 24ᵉ / 33 | llm-stats | Auto-déclaré |
| HMMT25 | 82,9 % | 12ᵉ / 25 | llm-stats | Auto-déclaré |
| MMLU-Pro | 82,5 % | 35ᵉ / 125 | llm-stats | Auto-déclaré |
| GPQA | 81,7 % | 68ᵉ / 219 | llm-stats | Auto-déclaré |
| MMMLU | 81,2 % | 39ᵉ / 49 | llm-stats | Auto-déclaré |
| t2-bench | 79,1 % | 14ᵉ / 23 | llm-stats | Auto-déclaré |
| MMLU-ProX | 76,3 % | 17ᵉ / 32 | llm-stats | Auto-déclaré |
| Include | 75,6 % | 16ᵉ / 31 | llm-stats | Auto-déclaré |
| WMT24++ | 72,6 % | 12ᵉ / 23 | llm-stats | Auto-déclaré |
| BFCL-V4 | 66,1 % | 7ᵉ / 13 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 65,6 % | 35ᵉ / 53 | llm-stats | Auto-déclaré |
| IFBench | 64,5 % | 22ᵉ / 27 | llm-stats | Auto-déclaré |
| AA-LCR | 63,0 % | 9ᵉ / 15 | llm-stats | Auto-déclaré |
| SuperGPQA | 58,2 % | 20ᵉ / 34 | llm-stats | Auto-déclaré |
| PolyMATH | 57,3 % | 9ᵉ / 23 | llm-stats | Auto-déclaré |
| NOVA-63 | 55,9 % | 8ᵉ / 11 | llm-stats | Auto-déclaré |
| LongBench v2 | 55,2 % | 11ᵉ / 15 | llm-stats | Auto-déclaré |
| Multi-Challenge | 54,5 % | 13ᵉ / 28 | llm-stats | Auto-déclaré |
| VITA-Bench | 29,8 % | 9ᵉ / 10 | llm-stats | Auto-déclaré |
| DeepPlanning | 18,0 % | 8ᵉ / 9 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| SiliconFlow | 0,1 $ | 0,15 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 55 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,03 $ |
| Latence moyenne par benchmark — Benchable | 1 h 04 min |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Qwen3.5-9B se classe dans le top 10 en Ethics et en Mathematics, ses deux résultats les plus solides. Ses scores en General Knowledge et en Email Classification sont également élevés, même si leurs rangs relatifs sont moins favorables. À sa sortie, son résultat sur GPQA le plaçait dans le top 26% des 167 LLM de sa génération. Son architecture associe Gated Delta Networks, gated attention et FFN, selon une disposition alternant plusieurs blocs DeltaNet avec un bloc d’attention. La longue fenêtre de contexte et l’encodeur vision élargissent son champ d’utilisation au-delà du texte court.
Limites et points d’attention. Reasoning constitue sa faiblesse la plus visible, avec un résultat inférieur à ceux obtenus dans les autres catégories et un classement en seconde moitié de tableau. Coding atteint un niveau plus solide, mais reste loin du groupe de tête. Les excellents pourcentages en General Knowledge et Email Classification doivent aussi être relativisés par des rangs modestes face aux modèles évalués. En contrepartie, Qwen3.5-9B coûte 95% de moins que la moyenne des LLM similaires et environ 55 fois moins cher que les modèles frontière. Il cible ainsi les usages multilingues, multimodaux et à long contexte qui privilégient des coûts d’inférence réduits.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).