Qwen3-235B-A22B-Instruct-2507
Publié par Qwen le 22 juillet 2025, Qwen3-235B-A22B-Instruct-2507 est un LLM causal open-weights sous licence Apache 2.0, avec usage commercial autorisé. Son architecture Qwen3-MoE réunit 235 milliards de paramètres, dont 22 milliards sont activés. Il fonctionne exclusivement en mode…
Publié par Qwen le 22 juillet 2025, Qwen3-235B-A22B-Instruct-2507 est un LLM causal open-weights sous licence Apache 2.0, avec usage commercial autorisé. Son architecture Qwen3-MoE réunit 235 milliards de paramètres, dont 22 milliards sont activés. Il fonctionne exclusivement en mode non-thinking et ne produit pas de blocs de raisonnement <think>.
Sa fenêtre native atteint 262 144 tokens et peut être étendue à 1 010 000 tokens avec Dual Chunk Attention et MInference. Ses connaissances s'arrêtent au 30 juin 2025. Le modèle couvre notamment le suivi d'instructions, le raisonnement logique, les mathématiques, les sciences, le code, l'usage d'outils et les connaissances multilingues de longue traîne.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 22 juillet 2025 |
| Multimodal | non |
| Paramètres | 235 milliards |
| Paramètres actifs | 22 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 19.6 | 105ᵉ / 137 |
| Code Index | 22.1 | 63ᵉ / 74 |
| Agentic Index | 3.8 | 58ᵉ / 68 |
| Math Index | 91.0 | 8ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| ZebraLogic | 95,0 % | 3ᵉ / 7 | llm-stats | Auto-déclaré |
| MMLU-Redux | 93,1 % | 14ᵉ / 48 | llm-stats | Auto-déclaré |
| IFEval | 88,7 % | 24ᵉ / 65 | llm-stats | Auto-déclaré |
| MultiPL-E | 87,9 % | 1ᵉ / 13 | llm-stats | Auto-déclaré |
| Creative Writing v3 | 87,5 % | 1ᵉ / 12 | llm-stats | Auto-déclaré |
| WritingBench | 85,2 % | 7ᵉ / 15 | llm-stats | Auto-déclaré |
| CSimpleQA | 84,3 % | 2ᵉ / 7 | llm-stats | Auto-déclaré |
| MMLU-Pro | 83,0 % | 30ᵉ / 125 | llm-stats | Auto-déclaré |
| Include | 79,5 % | 12ᵉ / 31 | llm-stats | Auto-déclaré |
| MMLU-ProX | 79,4 % | 11ᵉ / 32 | llm-stats | Auto-déclaré |
| Arena-Hard v2 | 79,2 % | 4ᵉ / 16 | llm-stats | Auto-déclaré |
| GPQA | 77,5 % | 88ᵉ / 219 | llm-stats | Auto-déclaré |
| Multi-IF | 77,5 % | 6ᵉ / 20 | llm-stats | Auto-déclaré |
| LiveBench 20241125 | 75,4 % | 5ᵉ / 14 | llm-stats | Auto-déclaré |
| Tau2 Retail | 71,3 % | 17ᵉ / 25 | llm-stats | Auto-déclaré |
| BFCL-v3 | 70,9 % | 9ᵉ / 19 | llm-stats | Auto-déclaré |
| AIME 2025 | 70,3 % | 83ᵉ / 108 | llm-stats | Auto-déclaré |
| SuperGPQA | 62,6 % | 15ᵉ / 34 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 57,3 % | 14ᵉ / 22 | llm-stats | Auto-déclaré |
| HMMT25 | 55,4 % | 20ᵉ / 25 | llm-stats | Auto-déclaré |
| SimpleQA | 54,3 % | 11ᵉ / 45 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 51,8 % | 45ᵉ / 53 | llm-stats | Auto-déclaré |
| PolyMATH | 50,2 % | 14ᵉ / 23 | llm-stats | Auto-déclaré |
| Tau2 Airline | 44,0 % | 22ᵉ / 22 | llm-stats | Auto-déclaré |
| ARC-AGI | 41,8 % | 7ᵉ / 7 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 92ᵉ | Qwen3 Max | 1424 |
| 93ᵉ | Nemotron 3 Ultra (550B A55B) | 1424 |
| 94ᵉ | Qwen3-235B-A22B-Instruct-2507 | 1423 |
| 95ᵉ | DeepSeek-V3.2 (Thinking) | 1423 |
| 96ᵉ | DeepSeek-V3.2-Exp | 1423 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,09 $ | 0,55 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 96 % en dessous de la moyenne des LLM similaires, et 61,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Notre analyse
Forces. Les mathématiques constituent son principal point fort : son Math Index le place dans le top 10 des modèles évalués. À sa sortie, il figurait aussi dans le top 19% des LLM de sa génération sur GPQA, ce qui le situait favorablement en raisonnement scientifique. Dans l'Arena text, il se classe dans la première moitié du panel, tout en restant à distance du modèle en tête. Sa très longue fenêtre de contexte convient au traitement de volumes textuels importants. Son autre avantage majeur est économique : sa tarification se situe 95% sous la moyenne des LLM similaires et environ 61.1 fois sous celle des modèles frontière.
Limites et points d'attention. Les résultats globaux sont nettement moins favorables que les performances mathématiques. L'Intelligence Index place le modèle dans le bas du classement, tandis que le Code Index et l'Agentic Index le situent également parmi les derniers modèles de leurs panels respectifs. Le mode non-thinking exclut la génération explicite de blocs de raisonnement, et l'extension au-delà du contexte natif repose sur Dual Chunk Attention et MInference. Ce modèle correspond surtout aux usages sensibles au coût, aux longs contextes et aux tâches mathématiques, plutôt qu'aux scénarios exigeant les meilleures capacités générales, agentiques ou de codage.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai).