Qwen3-235B-A22B-Thinking-2507
Publié par Qwen le 25 juillet 2025, Qwen3-235B-A22B-Thinking-2507 est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Son positionnement combine raisonnement approfondi, contexte natif de 262 144 tokens et tarification très économique, inférieure de 92% à la…
Publié par Qwen le 25 juillet 2025, Qwen3-235B-A22B-Thinking-2507 est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Son positionnement combine raisonnement approfondi, contexte natif de 262 144 tokens et tarification très économique, inférieure de 92% à la moyenne des LLM similaires.
Cette architecture à experts totalise 235 milliards de paramètres, dont 22 milliards activés, avec 94 couches et 128 experts, dont 8 mobilisés. Le modèle fonctionne exclusivement en mode thinking. Il couvre notamment le raisonnement, le codage, le suivi d’instructions, l’usage d’outils et la génération multilingue.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 25 juillet 2025 |
| Multimodal | non |
| Paramètres | 235 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MMLU-Redux | 93,8 % | 7ᵉ / 48 | llm-stats | Auto-déclaré |
| AIME 2025 | 92,3 % | 32ᵉ / 108 | llm-stats | Auto-déclaré |
| WritingBench | 88,3 % | 1ᵉ / 15 | llm-stats | Auto-déclaré |
| IFEval | 87,8 % | 28ᵉ / 65 | llm-stats | Auto-déclaré |
| Creative Writing v3 | 86,1 % | 3ᵉ / 12 | llm-stats | Auto-déclaré |
| MMLU-Pro | 84,4 % | 24ᵉ / 125 | llm-stats | Auto-déclaré |
| HMMT25 | 83,9 % | 11ᵉ / 25 | llm-stats | Auto-déclaré |
| GPQA | 81,1 % | 72ᵉ / 219 | llm-stats | Auto-déclaré |
| Include | 81,0 % | 8ᵉ / 31 | llm-stats | Auto-déclaré |
| MMLU-ProX | 81,0 % | 8ᵉ / 32 | llm-stats | Auto-déclaré |
| Multi-IF | 80,6 % | 1ᵉ / 20 | llm-stats | Auto-déclaré |
| Arena-Hard v2 | 79,7 % | 3ᵉ / 16 | llm-stats | Auto-déclaré |
| LiveBench 20241125 | 78,4 % | 2ᵉ / 14 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 74,1 % | 25ᵉ / 53 | llm-stats | Auto-déclaré |
| BFCL-v3 | 71,9 % | 6ᵉ / 19 | llm-stats | Auto-déclaré |
| Tau2 Retail | 71,9 % | 15ᵉ / 25 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 67,8 % | 15ᵉ / 24 | llm-stats | Auto-déclaré |
| SuperGPQA | 64,9 % | 11ᵉ / 34 | llm-stats | Auto-déclaré |
| PolyMATH | 60,1 % | 8ᵉ / 23 | llm-stats | Auto-déclaré |
| Tau2 Airline | 58,0 % | 12ᵉ / 22 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 46,0 % | 15ᵉ / 22 | llm-stats | Auto-déclaré |
| Tau2 Telecom | 45,6 % | 30ᵉ / 34 | llm-stats | Auto-déclaré |
| OJBench | 32,5 % | 6ᵉ / 9 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 18,2 % | 58ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 127ᵉ | LongCat-Flash-Chat | 1401 |
| 128ᵉ | Claude Sonnet 4 | 1399 |
| 129ᵉ | Qwen3-235B-A22B-Thinking-2507 | 1399 |
| 130ᵉ | DeepSeek-R1 | 1398 |
| 131ᵉ | Qwen: Qwen3.5-Flash | 1397 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Alibaba Cloud Int. | 0,1495 $ | 1,495 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 93 % en dessous de la moyenne des LLM similaires, et 36,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,79 $ |
| Latence moyenne par benchmark — Benchable | 40 min 45 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Qwen3-235B-A22B-Thinking-2507 atteint le premier rang en General Knowledge et figure dans le top 10 en Coding. Ses résultats sont également élevés en Reasoning et en Email Classification. À sa sortie, il se classait dans le top 13% des LLM de sa génération sur GPQA, ce qui le situait dans le haut du panier pour le raisonnement scientifique. Son contexte natif de 262 144 tokens convient aux entrées volumineuses, tandis qu’une configuration avec Dual Chunk Attention et MInference peut porter le traitement jusqu’à environ 1 million de tokens. Son coût constitue un autre avantage net : il est environ 36,8 fois moins cher que les modèles frontière.
Limites et points d'attention. Son classement Arena text se situe dans la seconde moitié du panel, nettement derrière le modèle en tête, malgré de solides résultats sur les tests spécialisés. Ethics et Hallucinations affichent des scores bruts élevés, mais des rangs relativement faibles, ce qui invite à ne pas confondre pourcentage absolu et position concurrentielle. Le fonctionnement exclusivement en mode thinking impose en outre un gabarit de chat intégrant automatiquement <think>, sans mode direct distinct. Ses connaissances s’arrêtent au 30 juin 2025. Il cible surtout les usages de raisonnement, de codage, d’analyse de longs contextes et les systèmes agentiques sensibles au coût.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).