Qwen: Qwen3.5-Flash

Qwen: Qwen3.5-Flash est un LLM d’Alibaba Cloud et de la Qwen Team, lancé le 25 février 2026. Sa fenêtre de contexte atteint 1 000 000 tokens, un format adapté au traitement de volumes de texte particulièrement importants.

Qwen: Qwen3.5-Flash est un LLM d’Alibaba Cloud et de la Qwen Team, lancé le 25 février 2026. Sa fenêtre de contexte atteint 1 000 000 tokens, un format adapté au traitement de volumes de texte particulièrement importants.

Le modèle se positionne surtout comme une option très économique. Sa tarification se situe 97% sous la moyenne des LLM similaires et environ 84.6 fois sous celle des modèles frontière. Son profil combine de bons résultats en mathématiques et en sciences avec des classements nettement moins favorables dans les évaluations humaines de texte et de code.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids▫ n.d.
Date de sortie25 février 2026
Multimodaloui
Fenêtre de contexte1 000 000 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image,video → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Email Classification (Baseline)97,4 %99ᵉ / 163benchable✅ Mesuré
Benchable : Hallucinations (Baseline)97,1 %66ᵉ / 146benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-202585,6 %16ᵉ / 64epoch✅ Mesuré
Epoch: GPQA diamond83,8 %19ᵉ / 85epoch✅ Mesuré
Benchable : Instruction Following (Baseline)63,6 %73ᵉ / 163benchable✅ Mesuré
Epoch: Chess Puzzles20,0 %12ᵉ / 20epoch✅ Mesuré
Epoch: SimpleQA Verified19,8 %23ᵉ / 26epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public10,0 %14ᵉ / 33epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private6,2 %19ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private0,0 %20ᵉ / 25epoch✅ Mesuré
Benchable : Coding (Baseline)0,0 %155ᵉ / 162benchable✅ Mesuré
Benchable : General Knowledge (Baseline)0,0 %153ᵉ / 161benchable✅ Mesuré
Benchable : Reasoning (Baseline)0,0 %152ᵉ / 155benchable✅ Mesuré
Benchable : Ethics (Baseline)0,0 %152ᵉ / 159benchable✅ Mesuré
Benchable : Mathematics (Baseline)0,0 %133ᵉ / 140benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
▶ Qwen3.5-Flash97 %

Benchable : Hallucinations (Baseline)

▶ Qwen3.5-Flash97 %

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
129ᵉQwen3-235B-A22B-Thinking-25071399
130ᵉDeepSeek-R11398
131ᵉQwen: Qwen3.5-Flash1397
132ᵉDeepSeek-V3 03241396
133ᵉQwen3.5-35B-A3B1396

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
87ᵉArcee AI: Trinity Large Thinking1243
88ᵉGPT-5.1 Codex Mini1240
89ᵉQwen: Qwen3.5-Flash1237
90ᵉGrok 4.1 Fast1234
91ᵉMistral Large 31224

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Alibaba Cloud Int.0,065 $0,26 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 97 % en dessous de la moyenne des LLM similaires, et 84,6 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,02 $
Latence moyenne par benchmark — Benchable8 min 53 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, Qwen: Qwen3.5-Flash figurait dans le top 23% des LLM de sa génération sur GPQA diamond (questions scientifiques de niveau doctorat). Il y partage la 19e place avec un autre modèle, sur un benchmark plafonné et donc peu discriminant. Sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée), il se place dans le premier quart. Email Classification et Hallucinations atteignent chacun 97%, même si leurs rangs sont moins flatteurs. Son coût très bas et son contexte d’un million de tokens constituent ses principaux atouts opérationnels.

Limites et points d’attention. Instruction Following reste en milieu de tableau. Le résultat de 20% aux Chess Puzzles le place au 12e rang partagé avec deux autres modèles, sur un benchmark également plafonné. Dans Arena text, il se classe 131e sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Claude Fable 5 est nettement devant. Dans Arena code, il tombe au 89e rang sur 99, derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. Kimi K3 est très nettement devant. Le modèle reste pertinent pour des traitements à gros volume où le coût et la longueur de contexte priment. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Kimi K3 ou Claude Opus 4.7.


Sources des données : OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).