Qwen3.7-Plus

Qwen3.7-Plus est un LLM propriétaire de Qwen, sorti le 31 mai 2026. Il se distingue par une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de volumes de texte particulièrement importants, et par des poids non ouverts.

Qwen3.7-Plus est un LLM propriétaire de Qwen, sorti le 31 mai 2026. Il se distingue par une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de volumes de texte particulièrement importants, et par des poids non ouverts.

À sa sortie, le modèle figurait dans le top 9% des LLM de sa génération sur GPQA. Son autre marqueur est son positionnement très économique : sa tarification se situe 84% sous la moyenne des LLM similaires et environ 17,2 fois sous celle des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🔒 Propriétaire
Date de sortie31 mai 2026
Multimodaloui
Fenêtre de contexte1 000 000 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index39.026ᵉ / 137
Code Index55.926ᵉ / 74
Agentic Index20.838ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
IFEval94,6 %2ᵉ / 65llm-statsAuto-déclaré
MMLU-Redux94,5 %3ᵉ / 48llm-statsAuto-déclaré
HMMT Feb 2692,9 %4ᵉ / 11llm-statsAuto-déclaré
MRCR v291,7 %1ᵉ / 3llm-statsAuto-déclaré
OmniDocBench 1.591,4 %2ᵉ / 13llm-statsAuto-déclaré
Global PIQA90,3 %4ᵉ / 13llm-statsAuto-déclaré
GPQA90,3 %21ᵉ / 219llm-statsAuto-déclaré
MathVision90,3 %5ᵉ / 32llm-statsAuto-déclaré
LiveCodeBench v689,6 %2ᵉ / 53llm-statsAuto-déclaré
MMMLU89,0 %14ᵉ / 49llm-statsAuto-déclaré
MAXIFE88,8 %2ᵉ / 11llm-statsAuto-déclaré
MMLU-Pro88,5 %2ᵉ / 125llm-statsAuto-déclaré
Video-MME88,0 %3ᵉ / 17llm-statsAuto-déclaré
MLVU87,4 %1ᵉ / 10llm-statsAuto-déclaré
RealWorldQA86,9 %1ᵉ / 25llm-statsAuto-déclaré
SpreadSheetBench-v186,3 %3ᵉ / 3llm-statsAuto-déclaré
IMO-AnswerBench86,0 %7ᵉ / 19llm-statsAuto-déclaré
CharXiv-R85,9 %10ᵉ / 45llm-statsAuto-déclaré
MMLU-ProX85,4 %2ᵉ / 32llm-statsAuto-déclaré
VideoMMMU85,4 %5ᵉ / 26llm-statsAuto-déclaré
WMT24++84,6 %4ᵉ / 23llm-statsAuto-déclaré
PolyMATH84,0 %2ᵉ / 23llm-statsAuto-déclaré
LingoQA83,4 %1ᵉ / 4llm-statsAuto-déclaré
Include83,0 %5ᵉ / 31llm-statsAuto-déclaré
SimpleVQA81,7 %1ᵉ / 13llm-statsAuto-déclaré
AndroidWorld81,0 %1ᵉ / 3llm-statsAuto-déclaré
IFBench79,1 %4ᵉ / 27llm-statsAuto-déclaré
MMMU-Pro79,0 %15ᵉ / 64llm-statsAuto-déclaré
ScreenSpot Pro79,0 %4ᵉ / 23llm-statsAuto-déclaré
TVBench78,2 %2ᵉ / 3llm-statsAuto-déclaré
SWE-Bench Verified77,7 %23ᵉ / 102llm-statsAuto-déclaré
LVBench76,2 %3ᵉ / 23llm-statsAuto-déclaré
SWE-bench Multilingual75,8 %9ᵉ / 34llm-statsAuto-déclaré
OSWorld-Verified73,3 %10ᵉ / 19llm-statsAuto-déclaré
MCP Atlas73,2 %16ᵉ / 30llm-statsAuto-déclaré
BFCL-V472,9 %2ᵉ / 13llm-statsAuto-déclaré
SuperGPQA71,4 %3ᵉ / 34llm-statsAuto-déclaré
BabyVision70,4 %4ᵉ / 9llm-statsAuto-déclaré
Terminal-Bench 2.070,3 %8ᵉ / 49llm-statsAuto-déclaré
ERQA69,8 %3ᵉ / 22llm-statsAuto-déclaré
OCRBench_V267,1 %1ᵉ / 7llm-statsAuto-déclaré
Claw-Eval62,7 %8ᵉ / 13llm-statsAuto-déclaré
DeepPlanning62,3 %1ᵉ / 9llm-statsAuto-déclaré
WorldVQA61,1 %1ᵉ / 5llm-statsAuto-déclaré
NOVA-6358,8 %3ᵉ / 11llm-statsAuto-déclaré
MCP-Mark58,7 %3ᵉ / 8llm-statsAuto-déclaré
SWE-Bench Pro57,6 %19ᵉ / 41llm-statsAuto-déclaré
ClawEval-MM55,7 %1ᵉ / 3llm-statsAuto-déclaré
SkillsBench54,9 %3ᵉ / 6llm-statsAuto-déclaré
SciCode51,3 %6ᵉ / 18llm-statsAuto-déclaré
ODinW51,1 %2ᵉ / 16llm-statsAuto-déclaré
VITA-Bench45,6 %3ᵉ / 10llm-statsAuto-déclaré
VisFactor42,8 %3ᵉ / 3llm-statsAuto-déclaré
NL2Repo41,1 %8ᵉ / 12llm-statsAuto-déclaré
Finance Agent v238,2 %17ᵉ / 26llm-statsn.d.
Humanity's Last Exam34,7 %38ᵉ / 89llm-statsAuto-déclaré
GDPval-AA31,5 %36ᵉ / 39llm-statsn.d.
CritPT6,0 %3ᵉ / 4llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Grok Build 0.1 061639.8
▶ Qwen3.7-Plus39.0
Nemotron 3 Ultra 550B A…37.8

Code Index

▶ Qwen3.7-Plus55.9
Grok Build 0.1 061651.5

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
37ᵉKimi K2.61461
38ᵉClaude Sonnet 51461
39ᵉQwen3.7-Plus1460
40ᵉQwen: Qwen3.6 Max Preview1460
41ᵉGrok-4.11459

Arena Document · 32 modèles classés

RangModèleElo
1ᵉClaude Opus 4.61508
2ᵉClaude Fable 51507
3ᵉClaude Opus 4.61507
16ᵉClaude Sonnet 4.51446
17ᵉMuse Spark1445
18ᵉQwen3.7-Plus1444
19ᵉGemini 3.1 Pro Preview1441
20ᵉMiniMax M31435

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
23ᵉdola-seed-2.0-pro1258
24ᵉGemini 3 Flash1258
25ᵉQwen3.7-Plus1257
26ᵉGemma 4 31B1255
27ᵉGPT-5.4 mini1254

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Alibaba Cloud Int.0,32 $1,28 $0,064 $
together0,32 $1,28 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 85 % en dessous de la moyenne des LLM similaires, et 17,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,13 $
Latence moyenne par benchmark — Benchable23 min 56 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Qwen3.7-Plus obtient des résultats très élevés en classification d’e-mails et sur le benchmark Hallucinations, tandis que son suivi des instructions reste solide. Son Code Index le place dans le premier tiers des modèles évalués, et son Intelligence Index dans le premier cinquième. Les évaluations Arena sont favorables en texte et en vision, où il se situe autour du premier cinquième des classements. Sa fenêtre de contexte de 1 000 000 tokens constitue un avantage concret pour les documents longs ou les ensembles volumineux. Le coût renforce ce positionnement, avec des tarifs minimaux de 0,32 $ par million de tokens en entrée et de 1,28 $ en sortie.

Limites et points d'attention. Les capacités agentiques sont moins convaincantes : l’Agentic Index place le modèle dans la seconde moitié du classement. L’Arena document est également moins favorable, avec une position dans la moitié basse, malgré un score relativement proche des meilleurs. Les poids propriétaires excluent les usages nécessitant un modèle ouvert. Qwen3.7-Plus cible ainsi surtout les traitements textuels à grande échelle, le code, la classification et les applications sensibles au coût, plutôt que les scénarios agentiques avancés ou centrés sur l’analyse documentaire.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).