Qwen3.5-27B

Publié par Qwen le 24 février 2026, Qwen3.5-27B est un LLM open-weights de 27 milliards de paramètres sous licence Apache 2.0, avec usage commercial autorisé. Son principal positionnement associe une fenêtre de contexte native de 262 144 tokens, un encodeur de vision et un tarif très…

Publié par Qwen le 24 février 2026, Qwen3.5-27B est un LLM open-weights de 27 milliards de paramètres sous licence Apache 2.0, avec usage commercial autorisé. Son principal positionnement associe une fenêtre de contexte native de 262 144 tokens, un encodeur de vision et un tarif très économique.

Le modèle prend en charge 201 langues et dialectes. Son architecture compte 64 couches combinant Gated DeltaNet, Gated Attention et FFN, avec un entraînement MTP multi-étapes. Les poids sont compatibles avec Transformers, vLLM, SGLang et KTransformers. Le contexte peut être étendu jusqu’à 1 010 000 tokens.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie24 février 2026
Multimodaloui
Paramètres27 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text,image,video → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index33.842ᵉ / 137

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
CountBench97,8 %1ᵉ / 6llm-statsAuto-déclaré
VLMsAreBlind96,9 %3ᵉ / 4llm-statsAuto-déclaré
IFEval95,0 %1ᵉ / 65llm-statsAuto-déclaré
V*93,7 %4ᵉ / 7llm-statsAuto-déclaré
MMLU-Redux93,2 %13ᵉ / 48llm-statsAuto-déclaré
AI2D92,9 %7ᵉ / 32llm-statsAuto-déclaré
MMBench-V1.192,6 %3ᵉ / 18llm-statsAuto-déclaré
HMMT 202592,0 %14ᵉ / 33llm-statsAuto-déclaré
RefCOCO-avg90,9 %6ᵉ / 7llm-statsAuto-déclaré
C-Eval90,5 %7ᵉ / 18llm-statsAuto-déclaré
HMMT2589,8 %7ᵉ / 25llm-statsAuto-déclaré
OCRBench89,4 %8ᵉ / 22llm-statsAuto-déclaré
OmniDocBench 1.588,9 %8ᵉ / 13llm-statsAuto-déclaré
MAXIFE88,0 %5ᵉ / 11llm-statsAuto-déclaré
MathVista-Mini87,8 %2ᵉ / 23llm-statsAuto-déclaré
DynaMath87,7 %2ᵉ / 7llm-statsAuto-déclaré
Global PIQA87,5 %8ᵉ / 13llm-statsAuto-déclaré
VideoMME w sub.87,0 %3ᵉ / 9llm-statsAuto-déclaré
MMLU-Pro86,1 %13ᵉ / 125llm-statsAuto-déclaré
MathVision86,0 %8ᵉ / 32llm-statsAuto-déclaré
MLVU85,9 %6ᵉ / 10llm-statsAuto-déclaré
MMMLU85,9 %26ᵉ / 49llm-statsAuto-déclaré
GPQA85,5 %46ᵉ / 219llm-statsAuto-déclaré
EmbSpatialBench84,5 %2ᵉ / 8llm-statsAuto-déclaré
RealWorldQA83,7 %9ᵉ / 25llm-statsAuto-déclaré
VideoMME w/o sub.82,8 %2ᵉ / 10llm-statsAuto-déclaré
MMMU82,3 %8ᵉ / 61llm-statsAuto-déclaré
VideoMMMU82,3 %14ᵉ / 26llm-statsAuto-déclaré
MMLU-ProX82,2 %6ᵉ / 32llm-statsAuto-déclaré
LingoQA82,0 %2ᵉ / 4llm-statsAuto-déclaré
Include81,6 %7ᵉ / 31llm-statsAuto-déclaré
CC-OCR81,0 %7ᵉ / 18llm-statsAuto-déclaré
MMStar81,0 %5ᵉ / 22llm-statsAuto-déclaré
CodeForces80,7 %7ᵉ / 16llm-statsAuto-déclaré
LiveCodeBench v680,7 %17ᵉ / 53llm-statsAuto-déclaré
SlakeVQA80,0 %2ᵉ / 4llm-statsAuto-déclaré
CharXiv-R79,5 %20ᵉ / 45llm-statsAuto-déclaré
t2-bench79,0 %15ᵉ / 23llm-statsAuto-déclaré
WMT24++77,6 %10ᵉ / 23llm-statsAuto-déclaré
IFBench76,5 %6ᵉ / 27llm-statsAuto-déclaré
MMMU-Pro75,0 %33ᵉ / 64llm-statsAuto-déclaré
MVBench74,6 %4ᵉ / 17llm-statsAuto-déclaré
LVBench73,6 %6ᵉ / 23llm-statsAuto-déclaré
MMVU73,3 %3ᵉ / 4llm-statsAuto-déclaré
SWE-Bench Verified72,4 %50ᵉ / 102llm-statsAuto-déclaré
PolyMATH71,2 %5ᵉ / 23llm-statsAuto-déclaré
ScreenSpot Pro70,3 %7ᵉ / 23llm-statsAuto-déclaré
Hallusion Bench70,0 %1ᵉ / 16llm-statsAuto-déclaré
BFCL-V468,5 %5ᵉ / 13llm-statsAuto-déclaré
RefSpatialBench67,7 %4ᵉ / 6llm-statsAuto-déclaré
AA-LCR66,1 %7ᵉ / 15llm-statsAuto-déclaré
SuperGPQA65,6 %9ᵉ / 34llm-statsAuto-déclaré
AndroidWorld_SR64,2 %3ᵉ / 8llm-statsAuto-déclaré
MedXpertQA62,4 %3ᵉ / 12llm-statsAuto-déclaré
PMC-VQA62,4 %2ᵉ / 3llm-statsAuto-déclaré
BrowseComp-zh62,1 %9ᵉ / 13llm-statsAuto-déclaré
WideSearch61,1 %6ᵉ / 9llm-statsAuto-déclaré
BrowseComp61,0 %33ᵉ / 57llm-statsAuto-déclaré
Multi-Challenge60,8 %9ᵉ / 28llm-statsAuto-déclaré
LongBench v260,6 %7ᵉ / 15llm-statsAuto-déclaré
ERQA60,5 %11ᵉ / 22llm-statsAuto-déclaré
MMLongBench-Doc60,2 %2ᵉ / 5llm-statsAuto-déclaré
FullStackBench en60,1 %2ᵉ / 3llm-statsAuto-déclaré
TIR-Bench59,8 %2ᵉ / 4llm-statsAuto-déclaré
NOVA-6358,1 %5ᵉ / 11llm-statsAuto-déclaré
FullStackBench zh57,4 %2ᵉ / 3llm-statsAuto-déclaré
OSWorld-Verified56,2 %17ᵉ / 19llm-statsAuto-déclaré
SimpleVQA56,0 %13ᵉ / 13llm-statsAuto-déclaré
Humanity's Last Exam48,5 %21ᵉ / 89llm-statsAuto-déclaré
Seal-047,2 %3ᵉ / 6llm-statsAuto-déclaré
BabyVision44,6 %7ᵉ / 9llm-statsAuto-déclaré
VITA-Bench41,9 %5ᵉ / 10llm-statsAuto-déclaré
Terminal-Bench 2.041,6 %43ᵉ / 49llm-statsAuto-déclaré
ODinW41,1 %14ᵉ / 16llm-statsAuto-déclaré
OJBench40,1 %3ᵉ / 9llm-statsAuto-déclaré
ZEROBench-Sub36,2 %1ᵉ / 5llm-statsAuto-déclaré
SUNRGBD35,4 %2ᵉ / 4llm-statsAuto-déclaré
DeepPlanning22,6 %7ᵉ / 9llm-statsAuto-déclaré
Nuscene15,2 %2ᵉ / 3llm-statsAuto-déclaré
Hypersim13,0 %2ᵉ / 4llm-statsAuto-déclaré
ZEROBench10,0 %6ᵉ / 9llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nemotron 3 Ultra 550B A…37.8
▶ Qwen3.5-27B33.8
Qwen3.5 397B A17B32.0

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
118ᵉmistral-medium-25081410
119ᵉgrok-4-07091410
120ᵉQwen3.5-27B1409
121ᵉGemini 2.5 Flash Preview1404
122ᵉGrok 4 Fast1404

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
66ᵉGemma 4 26B-A4B1361
67ᵉGrok 4.31360
68ᵉQwen3.5-27B1356
69ᵉGLM-4.61355
70ᵉlaguna-m.11355

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
47ᵉgpt-5-chat-2025-08-071225
48ᵉGemini 2.5 Flash Preview1225
49ᵉQwen3.5-27B1220
50ᵉMiMo-V2-Omni1218
51ᵉernie-5.0-preview-12201218

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Alibaba Cloud Int.0,195 $1,56 $n.d.
novita0,3 $2,4 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 91 % en dessous de la moyenne des LLM similaires, et 28,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,35 $
Latence moyenne par benchmark — Benchable30 min 51 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Qwen3.5-27B obtient un résultat presque parfait en Email Classification et un score élevé sur le test Hallucinations. Son suivi des instructions se situe également dans la partie supérieure du classement Benchable. À sa sortie, il figurait dans le top 15% des LLM de sa génération sur GPQA, ce qui souligne un niveau compétitif sur cette évaluation. Son positionnement tarifaire constitue un autre avantage net : ses prix sont inférieurs de 90% à la moyenne des LLM similaires et environ 28,2 fois plus bas que ceux des modèles frontière. La licence Apache 2.0, les poids ouverts, la vision et la large couverture linguistique renforcent son intérêt pour des déploiements personnalisés.

Limites et points d'attention. Les évaluations Benchable font apparaître des faiblesses majeures en General Knowledge, Coding et Reasoning, avec des résultats nuls et des positions proches du bas des classements. Les classements Arena sont plus nuancés, mais restent modestes en texte et en code. La vision présente un rang relatif plus favorable, sans rejoindre la tête du classement. L’Intelligence Index place le modèle dans le premier tiers du panel, sans en faire une référence générale. Qwen3.5-27B convient surtout aux usages sensibles au coût, à la classification d’e-mails, au suivi d’instructions, aux longs contextes et aux déploiements multilingues ou multimodaux, plutôt qu’aux tâches exigeantes de raisonnement, de connaissance générale ou de programmation.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).