Qwen: Qwen3.5-Flash
Qwen: Qwen3.5-Flash est un LLM d’Alibaba Cloud et de la Qwen Team, lancé le 25 février 2026. Sa fenêtre de contexte atteint 1 000 000 tokens, un format adapté au traitement de volumes de texte particulièrement importants.
Qwen: Qwen3.5-Flash est un LLM d’Alibaba Cloud et de la Qwen Team, lancé le 25 février 2026. Sa fenêtre de contexte atteint 1 000 000 tokens, un format adapté au traitement de volumes de texte particulièrement importants.
Le modèle se positionne surtout comme une option très économique. Sa tarification se situe 97% sous la moyenne des LLM similaires et environ 84.6 fois sous celle des modèles frontière. Son profil combine de bons résultats en mathématiques et en sciences avec des classements nettement moins favorables dans les évaluations humaines de texte et de code.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | ▫ n.d. |
| Date de sortie | 25 février 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image,video → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Email Classification (Baseline) | 97,4 % | 99ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 97,1 % | 66ᵉ / 146 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 85,6 % | 16ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 83,8 % | 19ᵉ / 85 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 63,6 % | 73ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: Chess Puzzles | 20,0 % | 12ᵉ / 20 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 19,8 % | 23ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 10,0 % | 14ᵉ / 33 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 6,2 % | 19ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 0,0 % | 20ᵉ / 25 | epoch | ✅ Mesuré |
| Benchable : Coding (Baseline) | 0,0 % | 155ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 0,0 % | 153ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 0,0 % | 152ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 0,0 % | 152ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 0,0 % | 133ᵉ / 140 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Email Classification (Baseline)
Benchable : Hallucinations (Baseline)
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 129ᵉ | Qwen3-235B-A22B-Thinking-2507 | 1399 |
| 130ᵉ | DeepSeek-R1 | 1398 |
| 131ᵉ | Qwen: Qwen3.5-Flash | 1397 |
| 132ᵉ | DeepSeek-V3 0324 | 1396 |
| 133ᵉ | Qwen3.5-35B-A3B | 1396 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 87ᵉ | Arcee AI: Trinity Large Thinking | 1243 |
| 88ᵉ | GPT-5.1 Codex Mini | 1240 |
| 89ᵉ | Qwen: Qwen3.5-Flash | 1237 |
| 90ᵉ | Grok 4.1 Fast | 1234 |
| 91ᵉ | Mistral Large 3 | 1224 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Alibaba Cloud Int. | 0,065 $ | 0,26 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 97 % en dessous de la moyenne des LLM similaires, et 84,6 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,02 $ |
| Latence moyenne par benchmark — Benchable | 8 min 53 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, Qwen: Qwen3.5-Flash figurait dans le top 23% des LLM de sa génération sur GPQA diamond (questions scientifiques de niveau doctorat). Il y partage la 19e place avec un autre modèle, sur un benchmark plafonné et donc peu discriminant. Sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée), il se place dans le premier quart. Email Classification et Hallucinations atteignent chacun 97%, même si leurs rangs sont moins flatteurs. Son coût très bas et son contexte d’un million de tokens constituent ses principaux atouts opérationnels.
Limites et points d’attention. Instruction Following reste en milieu de tableau. Le résultat de 20% aux Chess Puzzles le place au 12e rang partagé avec deux autres modèles, sur un benchmark également plafonné. Dans Arena text, il se classe 131e sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Claude Fable 5 est nettement devant. Dans Arena code, il tombe au 89e rang sur 99, derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. Kimi K3 est très nettement devant. Le modèle reste pertinent pour des traitements à gros volume où le coût et la longueur de contexte priment. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Kimi K3 ou Claude Opus 4.7.
Sources des données : OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).