Qwen3-235B-A22B-Instruct-2507

Publié par Qwen le 22 juillet 2025, Qwen3-235B-A22B-Instruct-2507 est un LLM causal open-weights sous licence Apache 2.0, avec usage commercial autorisé. Son architecture Qwen3-MoE réunit 235 milliards de paramètres, dont 22 milliards sont activés. Il fonctionne exclusivement en mode…

Publié par Qwen le 22 juillet 2025, Qwen3-235B-A22B-Instruct-2507 est un LLM causal open-weights sous licence Apache 2.0, avec usage commercial autorisé. Son architecture Qwen3-MoE réunit 235 milliards de paramètres, dont 22 milliards sont activés. Il fonctionne exclusivement en mode non-thinking et ne produit pas de blocs de raisonnement <think>.

Sa fenêtre native atteint 262 144 tokens et peut être étendue à 1 010 000 tokens avec Dual Chunk Attention et MInference. Ses connaissances s'arrêtent au 30 juin 2025. Le modèle couvre notamment le suivi d'instructions, le raisonnement logique, les mathématiques, les sciences, le code, l'usage d'outils et les connaissances multilingues de longue traîne.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie22 juillet 2025
Multimodalnon
Paramètres235 milliards
Paramètres actifs22 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index19.6105ᵉ / 137
Code Index22.163ᵉ / 74
Agentic Index3.858ᵉ / 68
Math Index91.08ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
ZebraLogic95,0 %3ᵉ / 7llm-statsAuto-déclaré
MMLU-Redux93,1 %14ᵉ / 48llm-statsAuto-déclaré
IFEval88,7 %24ᵉ / 65llm-statsAuto-déclaré
MultiPL-E87,9 %1ᵉ / 13llm-statsAuto-déclaré
Creative Writing v387,5 %1ᵉ / 12llm-statsAuto-déclaré
WritingBench85,2 %7ᵉ / 15llm-statsAuto-déclaré
CSimpleQA84,3 %2ᵉ / 7llm-statsAuto-déclaré
MMLU-Pro83,0 %30ᵉ / 125llm-statsAuto-déclaré
Include79,5 %12ᵉ / 31llm-statsAuto-déclaré
MMLU-ProX79,4 %11ᵉ / 32llm-statsAuto-déclaré
Arena-Hard v279,2 %4ᵉ / 16llm-statsAuto-déclaré
GPQA77,5 %88ᵉ / 219llm-statsAuto-déclaré
Multi-IF77,5 %6ᵉ / 20llm-statsAuto-déclaré
LiveBench 2024112575,4 %5ᵉ / 14llm-statsAuto-déclaré
Tau2 Retail71,3 %17ᵉ / 25llm-statsAuto-déclaré
BFCL-v370,9 %9ᵉ / 19llm-statsAuto-déclaré
AIME 202570,3 %83ᵉ / 108llm-statsAuto-déclaré
SuperGPQA62,6 %15ᵉ / 34llm-statsAuto-déclaré
Aider-Polyglot57,3 %14ᵉ / 22llm-statsAuto-déclaré
HMMT2555,4 %20ᵉ / 25llm-statsAuto-déclaré
SimpleQA54,3 %11ᵉ / 45llm-statsAuto-déclaré
LiveCodeBench v651,8 %45ᵉ / 53llm-statsAuto-déclaré
PolyMATH50,2 %14ᵉ / 23llm-statsAuto-déclaré
Tau2 Airline44,0 %22ᵉ / 22llm-statsAuto-déclaré
ARC-AGI41,8 %7ᵉ / 7llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nova 2.0 Pro Preview21.8
▶ Qwen3-235B-A22B-Instruc…19.6

Code Index

Nova 2.0 Pro Preview34.0
▶ Qwen3-235B-A22B-Instruc…22.1

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
92ᵉQwen3 Max1424
93ᵉNemotron 3 Ultra (550B A55B)1424
94ᵉQwen3-235B-A22B-Instruct-25071423
95ᵉDeepSeek-V3.2 (Thinking)1423
96ᵉDeepSeek-V3.2-Exp1423

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,09 $0,55 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 96 % en dessous de la moyenne des LLM similaires, et 61,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Notre analyse

Forces. Les mathématiques constituent son principal point fort : son Math Index le place dans le top 10 des modèles évalués. À sa sortie, il figurait aussi dans le top 19% des LLM de sa génération sur GPQA, ce qui le situait favorablement en raisonnement scientifique. Dans l'Arena text, il se classe dans la première moitié du panel, tout en restant à distance du modèle en tête. Sa très longue fenêtre de contexte convient au traitement de volumes textuels importants. Son autre avantage majeur est économique : sa tarification se situe 95% sous la moyenne des LLM similaires et environ 61.1 fois sous celle des modèles frontière.

Limites et points d'attention. Les résultats globaux sont nettement moins favorables que les performances mathématiques. L'Intelligence Index place le modèle dans le bas du classement, tandis que le Code Index et l'Agentic Index le situent également parmi les derniers modèles de leurs panels respectifs. Le mode non-thinking exclut la génération explicite de blocs de raisonnement, et l'extension au-delà du contexte natif repose sur Dual Chunk Attention et MInference. Ce modèle correspond surtout aux usages sensibles au coût, aux longs contextes et aux tâches mathématiques, plutôt qu'aux scénarios exigeant les meilleures capacités générales, agentiques ou de codage.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai).