qwen3.6-plus-04-02
qwen3.6-plus-04-02 est un LLM d’Alibaba Cloud et de la Qwen Team, sorti le 2 avril 2026. Son profil Benchable est très contrasté : il atteint le plafond sur Hallucinations et Email Classification, et obtient un résultat solide en suivi d’instructions.
qwen3.6-plus-04-02 est un LLM d’Alibaba Cloud et de la Qwen Team, sorti le 2 avril 2026. Son profil Benchable est très contrasté : il atteint le plafond sur Hallucinations et Email Classification, et obtient un résultat solide en suivi d’instructions.
Les évaluations de connaissances générales, de code et de raisonnement aboutissent en revanche à des scores nuls et à des places proches du bas du classement. Les résultats favorables proviennent par ailleurs de benchmarks plafonnés, qui départagent mal les modèles arrivés aux premières places.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | ▫ n.d. |
| Date de sortie | 2 avril 2026 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 100,0 % | 1ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 82,0 % | 26ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 0,0 % | 153ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 0,0 % | 155ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 0,0 % | 152ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 0,0 % | 152ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 0,0 % | 133ᵉ / 140 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Hallucinations (Baseline)
Benchable : Email Classification (Baseline)
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,13 $ |
| Latence moyenne par benchmark — Benchable | 17 min 20 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. qwen3.6-plus-04-02 obtient 100% sur Hallucinations, une première place partagée avec 45 autres modèles. Il atteint aussi 100% sur Email Classification, avec neuf autres modèles au même rang. Ces deux résultats montrent une réussite complète sur les tâches testées, mais leur caractère plafonné limite leur portée comparative. Sur Instruction Following, le modèle se place dans le haut du tableau avec 82% et une 26e place partagée sur 163 modèles. Ce résultat constitue son signal le plus distinctif, même si ce benchmark est également indiqué comme plafonné.
Limites et points d’attention. Le profil s’effondre sur General Knowledge, Coding et Reasoning, où le modèle obtient 0%. Il figure chaque fois parmi les derniers modèles classés. Ces résultats rendent son positionnement fragile pour les tâches qui exigent des connaissances générales, la production de code ou un raisonnement structuré. qwen3.6-plus-04-02 reste surtout pertinent comme candidat à évaluer pour la classification d’e-mails et le suivi d’instructions, dans des scénarios proches des protocoles où il obtient ses meilleurs résultats.
Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).