Qwen3 Max
Qwen3 Max est un LLM propriétaire de Qwen, lancé le 25 janvier 2026. Développé en Chine, il associe 1000 milliards de paramètres à une fenêtre de contexte de 262 144 tokens et à des connaissances arrêtées au 30 juin 2025.
Qwen3 Max est un LLM propriétaire de Qwen, lancé le 25 janvier 2026. Développé en Chine, il associe 1000 milliards de paramètres à une fenêtre de contexte de 262 144 tokens et à des connaissances arrêtées au 30 juin 2025.
Son entraînement représente 1,5 × 10²⁵ FLOP, soit environ 4,2 millions d’heures-GPU H100, l’équivalent de 1 900 GPU H100 pendant trois mois. Malgré cette échelle, son positionnement reste très économique, avec une tarification inférieure de 61% à la moyenne des LLM similaires et environ 7,1 fois moins élevée que celle des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🔒 Propriétaire |
| Date de sortie | 15 décembre 2025 |
| Multimodal | non |
| Paramètres | 1000 milliards |
| Fenêtre de contexte | 256 000 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 31.7 | 54ᵉ / 137 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 81,6 % | 61ᵉ / 108 | llm-stats | Auto-déclaré |
| t2-bench | 74,8 % | 16ᵉ / 23 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 69,6 % | 59ᵉ / 102 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 69,0 % | 32ᵉ / 53 | llm-stats | Auto-déclaré |
| SuperGPQA | 65,1 % | 10ᵉ / 34 | llm-stats | Auto-déclaré |
| GPQA | 62,0 % | 145ᵉ / 219 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 90ᵉ | deepseek-v3.2-exp-thinking | 1425 |
| 91ᵉ | Claude Opus 4 | 1424 |
| 92ᵉ | Qwen3 Max | 1424 |
| 93ᵉ | Nemotron 3 Ultra (550B A55B) | 1424 |
| 94ᵉ | Qwen3-235B-A22B-Instruct-2507 | 1423 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Alibaba Cloud Int. | 0,78 $ | 3,9 $ | n.d. |
| Alibaba Cloud Int. | 0,78 $ | 3,9 $ | 0,156 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 63 % en dessous de la moyenne des LLM similaires, et 7,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,05 $ |
| Latence moyenne par benchmark — Benchable | 3 min 45 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 1,5 × 10²⁵ FLOP |
| Taille du jeu d'entraînement | 3,6 × 10¹³ |
| Jeu de données | Unspecified unreleased |
| Pays | China |
Notre analyse
Forces. Qwen3 Max atteint le premier rang sur les évaluations Baseline de General Knowledge, Ethics, Email Classification et Hallucinations. Ces résultats signalent une forte maîtrise des connaissances générales, du classement d’e-mails et des réponses attendues dans les tests éthiques, ainsi qu’un excellent comportement sur le protocole consacré aux hallucinations. Les mathématiques et le code obtiennent également des scores absolus élevés. La fenêtre de 262 144 tokens constitue un autre atout concret pour traiter de longs contenus. Son rapport entre échelle et prix est particulièrement favorable, avec un coût d’entrée minimal de 0,78 $ par million de tokens et un coût de sortie de 3,9 $.
Limites et points d’attention. Les classements nuancent les scores bruts en mathématiques et en code, où Qwen3 Max reste loin des premières places. Son Intelligence Index le situe dans la seconde moitié du classement, tandis que son rang dans l’Arena text est également inférieur au milieu du tableau. À sa sortie, il figurait seulement dans le top 66% des LLM de sa génération sur GPQA, ce qui traduit un positionnement modeste en raisonnement avancé. Ses poids ne sont pas ouverts. Le modèle convient surtout aux usages sensibles au coût, aux longs contextes, aux connaissances générales et à la classification d’e-mails.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).