Qwen3.8 Max
Qwen3.8 Max est un LLM propriétaire de Qwen, originaire de Chine et sorti le 2 août 2026. Il combine 2400 milliards de paramètres avec une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de très grands volumes de texte.
Qwen3.8 Max est un LLM propriétaire de Qwen, originaire de Chine et sorti le 2 août 2026. Il combine 2400 milliards de paramètres avec une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de très grands volumes de texte.
Son positionnement tarifaire est économique. Les tarifs de 2 $ par million de tokens en entrée et de 6 $ en sortie se situent 2 % sous la moyenne des LLM similaires. Le modèle coûte environ 2.8 fois moins cher que les modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Qwen |
| Poids | 🔒 Propriétaire |
| Date de sortie | 2 août 2026 |
| Multimodal | oui |
| Paramètres | 2400 milliards |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image,video → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 251 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 99,4 % | 6ᵉ / 122 | epoch | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 98,5 % | 142ᵉ / 252 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 92ᵉ / 259 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 97,9 % | 4ᵉ / 226 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 95,9 % | 27ᵉ / 253 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 92,7 % | 13ᵉ / 143 | epoch | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 90,0 % | 155ᵉ / 233 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 83,0 % | 39ᵉ / 256 | benchable | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 74,7 % | 11ᵉ / 42 | epoch | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 70,0 % | 159ᵉ / 246 | benchable | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 46,3 % | 12ᵉ / 43 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 46,3 % | 27ᵉ / 63 | epoch | ✅ Mesuré |
| Epoch: Mystery Game Puzzles | 38,0 % | 5ᵉ / 21 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 29,0 % | 25ᵉ / 65 | epoch | ✅ Mesuré |
| PaperBench | 93,0 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| GPQA | 92,6 % | 12ᵉ / 221 | llm-stats | Auto-déclaré |
| VideoMME w sub. | 90,4 % | 1ᵉ / 10 | llm-stats | Auto-déclaré |
| RealWorldQA | 88,0 % | 1ᵉ / 26 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.1 | 86,6 % | 4ᵉ / 17 | llm-stats | Auto-déclaré |
| OSWorld-Verified | 86,1 % | 1ᵉ / 22 | llm-stats | Auto-déclaré |
| AndroidWorld | 85,3 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 84,5 % | 3ᵉ / 24 | llm-stats | Auto-déclaré |
| IFBench | 82,8 % | 1ᵉ / 28 | llm-stats | Auto-déclaré |
| MMMU-Pro | 82,3 % | 5ᵉ / 65 | llm-stats | Auto-déclaré |
| LVBench | 81,8 % | 1ᵉ / 24 | llm-stats | Auto-déclaré |
| ERQA | 77,8 % | 1ᵉ / 23 | llm-stats | Auto-déclaré |
| MobileWorld | 77,8 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| CoWorkBench | 74,8 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| FrontierSWE | 73,5 % | 5ᵉ / 15 | llm-stats | Auto-déclaré |
| SkillsBench | 70,2 % | 1ᵉ / 7 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 67,7 % | 4ᵉ / 44 | llm-stats | Auto-déclaré |
| LongBench v2 | 66,3 % | 1ᵉ / 16 | llm-stats | Auto-déclaré |
| HealthBench | 60,2 % | 1ᵉ / 9 | llm-stats | Auto-déclaré |
| DeepSWE 1.1 | 56,6 % | 9ᵉ / 19 | llm-stats | Auto-déclaré |
| NL2Repo | 55,9 % | 1ᵉ / 14 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 43,6 % | 28ᵉ / 91 | llm-stats | Auto-déclaré |
| MLS-Bench Lite | 41,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Ethics (Baseline)
Epoch: OTIS Mock AIME 2024-2025
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Code | 1668 | 4ᵉ / 109 | Kimi K3 (1676) |
| Arena Image-to-Code | 1631 | 2ᵉ / 42 | Claude Opus 5 (1670) |
| Arena Text | 1496 | 5ᵉ / 199 | Claude Fable 5 (1509) |
| Arena Vision | 1305 | 2ᵉ / 145 | Claude Fable 5 (1318) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Alibaba Cloud Int. | 2 $ | 6 $ | 0,25 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 2 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,33 $ |
| Latence moyenne par benchmark — Benchable | 35 min 11 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | China |
Notre analyse
Forces. À sa sortie, Qwen3.8 Max figurait dans le top 15 % des LLM de sa génération sur GPQA diamond. Ses meilleurs résultats concernent les mathématiques, avec un top 10 sur OTIS Mock AIME 2024-2025 et une quatrième place sur Mathematics. Dans l’Arena code, Kimi K3 et Claude Opus 5 le devancent en Elo, tandis que Claude Fable 5 se situe derrière lui. Qwen3.8 Max et Kimi K3 sont à peu près à parité. Il prend la deuxième place en image-to-code, derrière Claude Opus 5 et devant Claude Fable 5 et GPT-5.6 Sol. Qwen3.8 Max et Claude Opus 5 restent proches. En Arena text, il se classe cinquième derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec le premier est faible.
Limites et points d’attention. Sa 27e place sur Coding est moins convaincante que ses résultats dans l’Arena code. Les benchmarks Ethics, General Knowledge et Email Classification sont plafonnés et comptent de nombreux ex æquo. Sur Ethics, il partage ainsi la première place avec 118 autres modèles, ce qui rend le score peu discriminant. Le modèle reste pertinent pour les mathématiques, le code, l’image-to-code et les traitements nécessitant un contexte très long, avec un budget inférieur à celui des modèles haut de gamme.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).