Qwen3.8 Max

Qwen3.8 Max est un LLM propriétaire de Qwen, originaire de Chine et sorti le 2 août 2026. Il combine 2400 milliards de paramètres avec une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de très grands volumes de texte.

Qwen3.8 Max est un LLM propriétaire de Qwen, originaire de Chine et sorti le 2 août 2026. Il combine 2400 milliards de paramètres avec une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de très grands volumes de texte.

Son positionnement tarifaire est économique. Les tarifs de 2 $ par million de tokens en entrée et de 6 $ en sortie se situent 2 % sous la moyenne des LLM similaires. Le modèle coûte environ 2.8 fois moins cher que les modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurQwen
Poids🔒 Propriétaire
Date de sortie2 août 2026
Multimodaloui
Paramètres2400 milliards
Fenêtre de contexte1 000 000 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image,video → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 251benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-202599,4 %6ᵉ / 122epoch✅ Mesuré
Benchable : General Knowledge (Baseline)98,5 %142ᵉ / 252benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %92ᵉ / 259benchable✅ Mesuré
Benchable : Mathematics (Baseline)97,9 %4ᵉ / 226benchable✅ Mesuré
Benchable : Coding (Baseline)95,9 %27ᵉ / 253benchable✅ Mesuré
Epoch: GPQA diamond92,7 %13ᵉ / 143epoch✅ Mesuré
Benchable : Hallucinations (Baseline)90,0 %155ᵉ / 233benchable✅ Mesuré
Benchable : Instruction Following (Baseline)83,0 %39ᵉ / 256benchable✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private74,7 %11ᵉ / 42epoch✅ Mesuré
Benchable : Reasoning (Baseline)70,0 %159ᵉ / 246benchable✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private46,3 %12ᵉ / 43epoch✅ Mesuré
Epoch: SimpleQA Verified46,3 %27ᵉ / 63epoch✅ Mesuré
Epoch: Mystery Game Puzzles38,0 %5ᵉ / 21epoch✅ Mesuré
Epoch: Chess Puzzles29,0 %25ᵉ / 65epoch✅ Mesuré
PaperBench93,0 %1ᵉ / 3llm-statsAuto-déclaré
GPQA92,6 %12ᵉ / 221llm-statsAuto-déclaré
VideoMME w sub.90,4 %1ᵉ / 10llm-statsAuto-déclaré
RealWorldQA88,0 %1ᵉ / 26llm-statsAuto-déclaré
Terminal-Bench 2.186,6 %4ᵉ / 17llm-statsAuto-déclaré
OSWorld-Verified86,1 %1ᵉ / 22llm-statsAuto-déclaré
AndroidWorld85,3 %1ᵉ / 4llm-statsAuto-déclaré
ScreenSpot Pro84,5 %3ᵉ / 24llm-statsAuto-déclaré
IFBench82,8 %1ᵉ / 28llm-statsAuto-déclaré
MMMU-Pro82,3 %5ᵉ / 65llm-statsAuto-déclaré
LVBench81,8 %1ᵉ / 24llm-statsAuto-déclaré
ERQA77,8 %1ᵉ / 23llm-statsAuto-déclaré
MobileWorld77,8 %1ᵉ / 3llm-statsAuto-déclaré
CoWorkBench74,8 %1ᵉ / 3llm-statsAuto-déclaré
FrontierSWE73,5 %5ᵉ / 15llm-statsAuto-déclaré
SkillsBench70,2 %1ᵉ / 7llm-statsAuto-déclaré
SWE-Bench Pro67,7 %4ᵉ / 44llm-statsAuto-déclaré
LongBench v266,3 %1ᵉ / 16llm-statsAuto-déclaré
HealthBench60,2 %1ᵉ / 9llm-statsAuto-déclaré
DeepSWE 1.156,6 %9ᵉ / 19llm-statsAuto-déclaré
NL2Repo55,9 %1ᵉ / 14llm-statsAuto-déclaré
Humanity's Last Exam43,6 %28ᵉ / 91llm-statsAuto-déclaré
MLS-Bench Lite41,0 %2ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

▶ Qwen3.8 Max100 %
command-r-plus-08-202499 %

Epoch: OTIS Mock AIME 2024-2025

▶ Qwen3.8 Max99 %

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Code16684ᵉ / 109Kimi K3 (1676)
Arena Image-to-Code16312ᵉ / 42Claude Opus 5 (1670)
Arena Text14965ᵉ / 199Claude Fable 5 (1509)
Arena Vision13052ᵉ / 145Claude Fable 5 (1318)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Alibaba Cloud Int.2 $6 $0,25 $

Prix en dollars US par million de tokens.

Sa tarification se situe 2 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,33 $
Latence moyenne par benchmark — Benchable35 min 11 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
PaysChina

Notre analyse

Forces. À sa sortie, Qwen3.8 Max figurait dans le top 15 % des LLM de sa génération sur GPQA diamond. Ses meilleurs résultats concernent les mathématiques, avec un top 10 sur OTIS Mock AIME 2024-2025 et une quatrième place sur Mathematics. Dans l’Arena code, Kimi K3 et Claude Opus 5 le devancent en Elo, tandis que Claude Fable 5 se situe derrière lui. Qwen3.8 Max et Kimi K3 sont à peu près à parité. Il prend la deuxième place en image-to-code, derrière Claude Opus 5 et devant Claude Fable 5 et GPT-5.6 Sol. Qwen3.8 Max et Claude Opus 5 restent proches. En Arena text, il se classe cinquième derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec le premier est faible.

Limites et points d’attention. Sa 27e place sur Coding est moins convaincante que ses résultats dans l’Arena code. Les benchmarks Ethics, General Knowledge et Email Classification sont plafonnés et comptent de nombreux ex æquo. Sur Ethics, il partage ainsi la première place avec 118 autres modèles, ce qui rend le score peu discriminant. Le modèle reste pertinent pour les mathématiques, le code, l’image-to-code et les traitements nécessitant un contexte très long, avec un budget inférieur à celui des modèles haut de gamme.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).