Qwen3-235B-A22B-Thinking-2507

Publié par Qwen le 25 juillet 2025, Qwen3-235B-A22B-Thinking-2507 est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Son positionnement combine raisonnement approfondi, contexte natif de 262 144 tokens et tarification très économique, inférieure de 92% à la…

Publié par Qwen le 25 juillet 2025, Qwen3-235B-A22B-Thinking-2507 est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Son positionnement combine raisonnement approfondi, contexte natif de 262 144 tokens et tarification très économique, inférieure de 92% à la moyenne des LLM similaires.

Cette architecture à experts totalise 235 milliards de paramètres, dont 22 milliards activés, avec 94 couches et 128 experts, dont 8 mobilisés. Le modèle fonctionne exclusivement en mode thinking. Il couvre notamment le raisonnement, le codage, le suivi d’instructions, l’usage d’outils et la génération multilingue.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie25 juillet 2025
Multimodalnon
Paramètres235 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MMLU-Redux93,8 %7ᵉ / 48llm-statsAuto-déclaré
AIME 202592,3 %32ᵉ / 108llm-statsAuto-déclaré
WritingBench88,3 %1ᵉ / 15llm-statsAuto-déclaré
IFEval87,8 %28ᵉ / 65llm-statsAuto-déclaré
Creative Writing v386,1 %3ᵉ / 12llm-statsAuto-déclaré
MMLU-Pro84,4 %24ᵉ / 125llm-statsAuto-déclaré
HMMT2583,9 %11ᵉ / 25llm-statsAuto-déclaré
GPQA81,1 %72ᵉ / 219llm-statsAuto-déclaré
Include81,0 %8ᵉ / 31llm-statsAuto-déclaré
MMLU-ProX81,0 %8ᵉ / 32llm-statsAuto-déclaré
Multi-IF80,6 %1ᵉ / 20llm-statsAuto-déclaré
Arena-Hard v279,7 %3ᵉ / 16llm-statsAuto-déclaré
LiveBench 2024112578,4 %2ᵉ / 14llm-statsAuto-déclaré
LiveCodeBench v674,1 %25ᵉ / 53llm-statsAuto-déclaré
BFCL-v371,9 %6ᵉ / 19llm-statsAuto-déclaré
Tau2 Retail71,9 %15ᵉ / 25llm-statsAuto-déclaré
TAU-bench Retail67,8 %15ᵉ / 24llm-statsAuto-déclaré
SuperGPQA64,9 %11ᵉ / 34llm-statsAuto-déclaré
PolyMATH60,1 %8ᵉ / 23llm-statsAuto-déclaré
Tau2 Airline58,0 %12ᵉ / 22llm-statsAuto-déclaré
TAU-bench Airline46,0 %15ᵉ / 22llm-statsAuto-déclaré
Tau2 Telecom45,6 %30ᵉ / 34llm-statsAuto-déclaré
OJBench32,5 %6ᵉ / 9llm-statsAuto-déclaré
Humanity's Last Exam18,2 %58ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
127ᵉLongCat-Flash-Chat1401
128ᵉClaude Sonnet 41399
129ᵉQwen3-235B-A22B-Thinking-25071399
130ᵉDeepSeek-R11398
131ᵉQwen: Qwen3.5-Flash1397

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Alibaba Cloud Int.0,1495 $1,495 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 93 % en dessous de la moyenne des LLM similaires, et 36,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,79 $
Latence moyenne par benchmark — Benchable40 min 45 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Qwen3-235B-A22B-Thinking-2507 atteint le premier rang en General Knowledge et figure dans le top 10 en Coding. Ses résultats sont également élevés en Reasoning et en Email Classification. À sa sortie, il se classait dans le top 13% des LLM de sa génération sur GPQA, ce qui le situait dans le haut du panier pour le raisonnement scientifique. Son contexte natif de 262 144 tokens convient aux entrées volumineuses, tandis qu’une configuration avec Dual Chunk Attention et MInference peut porter le traitement jusqu’à environ 1 million de tokens. Son coût constitue un autre avantage net : il est environ 36,8 fois moins cher que les modèles frontière.

Limites et points d'attention. Son classement Arena text se situe dans la seconde moitié du panel, nettement derrière le modèle en tête, malgré de solides résultats sur les tests spécialisés. Ethics et Hallucinations affichent des scores bruts élevés, mais des rangs relativement faibles, ce qui invite à ne pas confondre pourcentage absolu et position concurrentielle. Le fonctionnement exclusivement en mode thinking impose en outre un gabarit de chat intégrant automatiquement <think>, sans mode direct distinct. Ses connaissances s’arrêtent au 30 juin 2025. Il cible surtout les usages de raisonnement, de codage, d’analyse de longs contextes et les systèmes agentiques sensibles au coût.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).