Qwen 3.5 Plus

Publié le 16 février 2026, Qwen 3.5 Plus est un grand modèle de langage développé par Qwen. À sa sortie, il se situe dans le haut du panier de sa génération pour les questions scientifiques complexes.

Publié le 16 février 2026, Qwen 3.5 Plus est un grand modèle de langage développé par Qwen. À sa sortie, il se situe dans le haut du panier de sa génération pour les questions scientifiques complexes.

Son profil ressort surtout dans les évaluations de mathématiques et de sciences, des olympiades de niveau lycée aux problèmes de recherche et aux questions de niveau doctorat. Les tests de classification d’e-mails, de suivi d’instructions et d’hallucinations apportent des résultats plus contrastés, sur des benchmarks souvent plafonnés.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurQwen
Poids▫ n.d.
Date de sortie16 février 2026

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Email Classification (Baseline)100,0 %1ᵉ / 163benchable✅ Mesuré
Benchable : Hallucinations (Baseline)98,0 %47ᵉ / 146benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-202585,0 %17ᵉ / 64epoch✅ Mesuré
Epoch: GPQA diamond84,2 %18ᵉ / 85epoch✅ Mesuré
Benchable : Instruction Following (Baseline)76,0 %39ᵉ / 163benchable✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public50,0 %5ᵉ / 33epoch✅ Mesuré
Epoch: SimpleQA Verified26,0 %19ᵉ / 26epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private21,0 %10ᵉ / 32epoch✅ Mesuré
Epoch: Chess Puzzles17,0 %16ᵉ / 20epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private2,1 %15ᵉ / 25epoch✅ Mesuré
Benchable : General Knowledge (Baseline)0,0 %153ᵉ / 161benchable✅ Mesuré
Benchable : Coding (Baseline)0,0 %155ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)0,0 %152ᵉ / 155benchable✅ Mesuré
Benchable : Ethics (Baseline)0,0 %152ᵉ / 159benchable✅ Mesuré
Benchable : Mathematics (Baseline)0,0 %133ᵉ / 140benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
▶ Qwen 3.5 Plus100 %

Benchable : Hallucinations (Baseline)

Hy398 %
▶ Qwen 3.5 Plus98 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,24 $
Latence moyenne par benchmark — Benchable25 min 25 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, Qwen 3.5 Plus figurait dans le top 19% des LLM de sa génération sur GPQA diamond, qui mesure les réponses à des questions scientifiques de niveau doctorat. Il obtient aussi un résultat solide sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée. Sur FrontierMath, une épreuve de mathématiques de recherche très difficile, il partage la 5e place avec un autre modèle. Ce dernier benchmark est toutefois plafonné et départage imparfaitement les meilleurs résultats. En classification d’e-mails, son score maximal lui vaut également de partager la 1re place avec neuf autres modèles.

Limites et points d'attention. Le suivi d’instructions est moins convaincant, avec une 39e place partagée sur 163 modèles. Sur la baseline Hallucinations, le score brut atteint 98%, mais Qwen 3.5 Plus partage seulement la 47e place avec 18 autres modèles. Ces deux benchmarks sont plafonnés et offrent donc peu de pouvoir discriminant. Le modèle présente ainsi son meilleur profil sur les tâches scientifiques et mathématiques mesurées ici, tandis que son positionnement est moins distinctif pour le suivi d’instructions et l’évaluation des hallucinations.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).