Qwen3.7 Max
Qwen3.7 Max est un LLM propriétaire de Qwen, éditeur chinois, sorti le 19 mai 2026. Sa fenêtre de contexte de 1 000 000 tokens constitue l’un de ses principaux signes distinctifs, avec une capacité adaptée au traitement de très grands volumes de texte.
Qwen3.7 Max est un LLM propriétaire de Qwen, éditeur chinois, sorti le 19 mai 2026. Sa fenêtre de contexte de 1 000 000 tokens constitue l’un de ses principaux signes distinctifs, avec une capacité adaptée au traitement de très grands volumes de texte.
Le modèle associe de solides résultats généraux, scientifiques, mathématiques, agentiques et en code à un positionnement très économique. Sa tarification se situe 37% sous la moyenne des LLM similaires et environ 4,4 fois sous celle des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🔒 Propriétaire |
| Date de sortie | 19 mai 2026 |
| Multimodal | non |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 46.0 | 11ᵉ / 137 |
| Code Index | 66.0 | 12ᵉ / 74 |
| Agentic Index | 30.6 | 17ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| HMMT Feb 26 | 97,1 % | 1ᵉ / 11 | llm-stats | Auto-déclaré |
| MMLU-Redux | 95,0 % | 1ᵉ / 48 | llm-stats | Auto-déclaré |
| IFEval | 94,3 % | 3ᵉ / 65 | llm-stats | Auto-déclaré |
| GPQA | 92,4 % | 11ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 91,6 % | 1ᵉ / 53 | llm-stats | Auto-déclaré |
| Global PIQA | 91,4 % | 3ᵉ / 13 | llm-stats | Auto-déclaré |
| MMMLU | 90,3 % | 8ᵉ / 49 | llm-stats | Auto-déclaré |
| IMO-AnswerBench | 90,0 % | 3ᵉ / 19 | llm-stats | Auto-déclaré |
| MMLU-Pro | 89,6 % | 1ᵉ / 125 | llm-stats | Auto-déclaré |
| MAXIFE | 89,2 % | 1ᵉ / 11 | llm-stats | Auto-déclaré |
| MMLU-ProX | 87,0 % | 1ᵉ / 32 | llm-stats | Auto-déclaré |
| SpreadSheetBench-v1 | 87,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| PolyMATH | 86,5 % | 1ᵉ / 23 | llm-stats | Auto-déclaré |
| Include | 86,2 % | 2ᵉ / 31 | llm-stats | Auto-déclaré |
| WMT24++ | 85,8 % | 3ᵉ / 23 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 80,4 % | 11ᵉ / 102 | llm-stats | Auto-déclaré |
| IFBench | 79,1 % | 4ᵉ / 27 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 78,3 % | 3ᵉ / 34 | llm-stats | Auto-déclaré |
| MCP Atlas | 76,4 % | 10ᵉ / 30 | llm-stats | Auto-déclaré |
| BFCL-V4 | 75,0 % | 1ᵉ / 13 | llm-stats | Auto-déclaré |
| LiveBench | 74,3 % | 19ᵉ / 38 | llm-stats | n.d. |
| SuperGPQA | 73,6 % | 1ᵉ / 34 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 69,7 % | 9ᵉ / 49 | llm-stats | Auto-déclaré |
| Claw-Eval | 65,2 % | 5ᵉ / 13 | llm-stats | Auto-déclaré |
| ZClawBench | 64,3 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| MCP-Mark | 60,8 % | 2ᵉ / 8 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 60,6 % | 12ᵉ / 41 | llm-stats | Auto-déclaré |
| SkillsBench | 59,2 % | 1ᵉ / 6 | llm-stats | Auto-déclaré |
| NOVA-63 | 59,0 % | 2ᵉ / 11 | llm-stats | Auto-déclaré |
| SciCode | 53,5 % | 4ᵉ / 18 | llm-stats | Auto-déclaré |
| Finance Agent v2 | 48,4 % | 8ᵉ / 26 | llm-stats | n.d. |
| VITA-Bench | 47,9 % | 2ᵉ / 10 | llm-stats | Auto-déclaré |
| NL2Repo | 47,2 % | 2ᵉ / 12 | llm-stats | Auto-déclaré |
| MathArena Apex | 44,5 % | 3ᵉ / 7 | llm-stats | Auto-déclaré |
| GDPval-AA | 43,6 % | 18ᵉ / 39 | llm-stats | n.d. |
| Humanity's Last Exam | 41,4 % | 29ᵉ / 89 | llm-stats | Auto-déclaré |
| CritPT | 11,4 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 15ᵉ | GLM-5.1 | 1526 |
| 16ᵉ | Claude Sonnet 4.6 | 1522 |
| 17ᵉ | Qwen3.7 Max | 1516 |
| 18ᵉ | Kimi K2.6 | 1515 |
| 19ᵉ | Gemini 3.5 Flash | 1504 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| novita | 1,25 $ | 3,75 $ | n.d. |
| Alibaba Cloud Int. | 1,475 $ | 4,425 $ | 0,295 $ |
| together | 2,5 $ | 7,5 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 40 % en dessous de la moyenne des LLM similaires, et 4,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 20,51 $ |
| Durée d'exécution — PinchBench | 3 h 20 min |
| Indice valeur/coût — PinchBench | 4,81 |
| Coût moyen par benchmark — Benchable | 0,55 $ |
| Latence moyenne par benchmark — Benchable | 14 min 33 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | China |
Notre analyse
Forces. Qwen3.7 Max se classe parmi les meilleurs modèles de l’Intelligence Index et obtient la première place sur PinchBench, consacré aux tâches agentiques, ainsi que sur Hallucinations (Baseline). Ses résultats sont également élevés sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée) et GPQA diamond (questions scientifiques de niveau doctorat). À sa sortie, il appartenait au top 11% des LLM de sa génération sur GPQA diamond. Le Code Index le place dans le haut du classement, tandis que la fenêtre de contexte de 1 000 000 tokens renforce son intérêt pour les traitements documentaires volumineux. Son coût constitue un autre avantage net face aux modèles comparables et aux modèles frontière.
Limites et points d’attention. Les performances sont moins dominantes sur LiveBench: Mathematics, où le modèle se situe dans la seconde moitié du classement observé. En code, son classement Arena Code reste solide mais éloigné de la première place. L’Agentic Index est également moins favorable que son résultat de premier rang sur PinchBench, ce qui invite à distinguer les types d’évaluations agentiques. Enfin, la licence propriétaire exclut l’accès aux poids. Qwen3.7 Max cible ainsi les usages nécessitant un long contexte, de bonnes capacités scientifiques, mathématiques, agentiques ou de code, avec une forte contrainte de coût.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).