Qwen3 Max

Qwen3 Max est un LLM propriétaire de Qwen, lancé le 25 janvier 2026. Développé en Chine, il associe 1000 milliards de paramètres à une fenêtre de contexte de 262 144 tokens et à des connaissances arrêtées au 30 juin 2025.

Qwen3 Max est un LLM propriétaire de Qwen, lancé le 25 janvier 2026. Développé en Chine, il associe 1000 milliards de paramètres à une fenêtre de contexte de 262 144 tokens et à des connaissances arrêtées au 30 juin 2025.

Son entraînement représente 1,5 × 10²⁵ FLOP, soit environ 4,2 millions d’heures-GPU H100, l’équivalent de 1 900 GPU H100 pendant trois mois. Malgré cette échelle, son positionnement reste très économique, avec une tarification inférieure de 61% à la moyenne des LLM similaires et environ 7,1 fois moins élevée que celle des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🔒 Propriétaire
Date de sortie15 décembre 2025
Multimodalnon
Paramètres1000 milliards
Fenêtre de contexte256 000 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index31.754ᵉ / 137

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202581,6 %61ᵉ / 108llm-statsAuto-déclaré
t2-bench74,8 %16ᵉ / 23llm-statsAuto-déclaré
SWE-Bench Verified69,6 %59ᵉ / 102llm-statsAuto-déclaré
LiveCodeBench v669,0 %32ᵉ / 53llm-statsAuto-déclaré
SuperGPQA65,1 %10ᵉ / 34llm-statsAuto-déclaré
GPQA62,0 %145ᵉ / 219llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Qwen3.5 397B A17B32.0
▶ Qwen3 Max31.7

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
90ᵉdeepseek-v3.2-exp-thinking1425
91ᵉClaude Opus 41424
92ᵉQwen3 Max1424
93ᵉNemotron 3 Ultra (550B A55B)1424
94ᵉQwen3-235B-A22B-Instruct-25071423

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Alibaba Cloud Int.0,78 $3,9 $n.d.
Alibaba Cloud Int.0,78 $3,9 $0,156 $

Prix en dollars US par million de tokens.

Sa tarification se situe 63 % en dessous de la moyenne des LLM similaires, et 7,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,05 $
Latence moyenne par benchmark — Benchable3 min 45 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement1,5 × 10²⁵ FLOP
Taille du jeu d'entraînement3,6 × 10¹³
Jeu de donnéesUnspecified unreleased
PaysChina

Notre analyse

Forces. Qwen3 Max atteint le premier rang sur les évaluations Baseline de General Knowledge, Ethics, Email Classification et Hallucinations. Ces résultats signalent une forte maîtrise des connaissances générales, du classement d’e-mails et des réponses attendues dans les tests éthiques, ainsi qu’un excellent comportement sur le protocole consacré aux hallucinations. Les mathématiques et le code obtiennent également des scores absolus élevés. La fenêtre de 262 144 tokens constitue un autre atout concret pour traiter de longs contenus. Son rapport entre échelle et prix est particulièrement favorable, avec un coût d’entrée minimal de 0,78 $ par million de tokens et un coût de sortie de 3,9 $.

Limites et points d’attention. Les classements nuancent les scores bruts en mathématiques et en code, où Qwen3 Max reste loin des premières places. Son Intelligence Index le situe dans la seconde moitié du classement, tandis que son rang dans l’Arena text est également inférieur au milieu du tableau. À sa sortie, il figurait seulement dans le top 66% des LLM de sa génération sur GPQA, ce qui traduit un positionnement modeste en raisonnement avancé. Ses poids ne sont pas ouverts. Le modèle convient surtout aux usages sensibles au coût, aux longs contextes, aux connaissances générales et à la classification d’e-mails.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).