Qwen 3.5 Plus
Publié le 16 février 2026, Qwen 3.5 Plus est un grand modèle de langage développé par Qwen. À sa sortie, il se situe dans le haut du panier de sa génération pour les questions scientifiques complexes.
Publié le 16 février 2026, Qwen 3.5 Plus est un grand modèle de langage développé par Qwen. À sa sortie, il se situe dans le haut du panier de sa génération pour les questions scientifiques complexes.
Son profil ressort surtout dans les évaluations de mathématiques et de sciences, des olympiades de niveau lycée aux problèmes de recherche et aux questions de niveau doctorat. Les tests de classification d’e-mails, de suivi d’instructions et d’hallucinations apportent des résultats plus contrastés, sur des benchmarks souvent plafonnés.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Qwen |
| Poids | ▫ n.d. |
| Date de sortie | 16 février 2026 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Email Classification (Baseline) | 100,0 % | 1ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 98,0 % | 47ᵉ / 146 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 85,0 % | 17ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 84,2 % | 18ᵉ / 85 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 76,0 % | 39ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 50,0 % | 5ᵉ / 33 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 26,0 % | 19ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 21,0 % | 10ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 17,0 % | 16ᵉ / 20 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 2,1 % | 15ᵉ / 25 | epoch | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 0,0 % | 153ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 0,0 % | 155ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 0,0 % | 152ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 0,0 % | 152ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 0,0 % | 133ᵉ / 140 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Email Classification (Baseline)
Benchable : Hallucinations (Baseline)
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,24 $ |
| Latence moyenne par benchmark — Benchable | 25 min 25 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, Qwen 3.5 Plus figurait dans le top 19% des LLM de sa génération sur GPQA diamond, qui mesure les réponses à des questions scientifiques de niveau doctorat. Il obtient aussi un résultat solide sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée. Sur FrontierMath, une épreuve de mathématiques de recherche très difficile, il partage la 5e place avec un autre modèle. Ce dernier benchmark est toutefois plafonné et départage imparfaitement les meilleurs résultats. En classification d’e-mails, son score maximal lui vaut également de partager la 1re place avec neuf autres modèles.
Limites et points d'attention. Le suivi d’instructions est moins convaincant, avec une 39e place partagée sur 163 modèles. Sur la baseline Hallucinations, le score brut atteint 98%, mais Qwen 3.5 Plus partage seulement la 47e place avec 18 autres modèles. Ces deux benchmarks sont plafonnés et offrent donc peu de pouvoir discriminant. Le modèle présente ainsi son meilleur profil sur les tâches scientifiques et mathématiques mesurées ici, tandis que son positionnement est moins distinctif pour le suivi d’instructions et l’évaluation des hallucinations.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).