Qwen3 235B A22B

Qwen3 235B A22B est un LLM open-weights de Qwen, publié le 25 juillet 2025 sous licence Apache 2.0, avec usage commercial autorisé. Cette architecture mixture-of-experts réunit 235 milliards de paramètres, dont 22 milliards activés, répartis entre 128 experts et 94 couches.

Qwen3 235B A22B est un LLM open-weights de Qwen, publié le 25 juillet 2025 sous licence Apache 2.0, avec usage commercial autorisé. Cette architecture mixture-of-experts réunit 235 milliards de paramètres, dont 22 milliards activés, répartis entre 128 experts et 94 couches.

Le modèle distingue un mode « thinking » consacré au raisonnement et un mode « non-thinking » destiné au dialogue général. Il prend en charge la génération de code, les appels d’outils et plus de 100 langues et dialectes. Son contexte natif de 32 768 tokens peut atteindre 131 072 tokens via YaRN. Son entraînement représente environ 1,3 million d’heures-GPU H100.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie29 avril 2025
Multimodalnon
Paramètres235 milliards
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Arena Hard95,6 %1ᵉ / 26llm-statsAuto-déclaré
GSM8k94,4 %16ᵉ / 47llm-statsAuto-déclaré
BBH88,9 %1ᵉ / 12llm-statsAuto-déclaré
MMLU87,8 %18ᵉ / 98llm-statsAuto-déclaré
MMLU-Redux87,4 %31ᵉ / 48llm-statsAuto-déclaré
MMMLU86,7 %21ᵉ / 49llm-statsAuto-déclaré
AIME 202485,7 %17ᵉ / 52llm-statsAuto-déclaré
MGSM83,5 %15ᵉ / 30llm-statsAuto-déclaré
AIME 202581,5 %62ᵉ / 108llm-statsAuto-déclaré
MBPP81,4 %11ᵉ / 33llm-statsAuto-déclaré
EvalPlus77,6 %3ᵉ / 4llm-statsAuto-déclaré
LiveBench77,1 %7ᵉ / 38llm-statsAuto-déclaré
Include73,5 %19ᵉ / 31llm-statsAuto-déclaré
MATH71,8 %34ᵉ / 70llm-statsAuto-déclaré
BFCL70,8 %5ᵉ / 11llm-statsAuto-déclaré
LiveCodeBench70,7 %21ᵉ / 72llm-statsAuto-déclaré
MMLU-Pro68,2 %87ᵉ / 125llm-statsAuto-déclaré
MultiPL-E65,9 %11ᵉ / 13llm-statsAuto-déclaré
Aider61,8 %2ᵉ / 4llm-statsAuto-déclaré
GPQA47,5 %170ᵉ / 219llm-statsAuto-déclaré
SuperGPQA44,1 %31ᵉ / 34llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
122ᵉGrok 4 Fast1404
123ᵉGPT-5.4 nano1404
124ᵉQwen3 235B A22B1403
125ᵉo11402
126ᵉQwen3-Next-80B-A3B-Instruct1401

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
122ᵉGrok 4 Fast1404
123ᵉGPT-5.4 nano1404
124ᵉQwen3 235B A22B1403
125ᵉo11402
126ᵉQwen3-Next-80B-A3B-Instruct1401

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Alibaba Cloud Int.0,455 $1,82 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 78 % en dessous de la moyenne des LLM similaires, et 12,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement4,8 × 10²⁴ FLOP
Taille du jeu d'entraînement3,6 × 10¹³
Jeu de donnéesUnspecified unreleased
PaysChina

Notre analyse

Forces. À sa sortie, Qwen3 235B A22B figurait dans le top 8% des LLM de sa génération sur GPQA diamond, qui évalue les questions scientifiques de niveau doctorat. Ses résultats sur OTIS Mock AIME et MATH level 5 confirment de bonnes aptitudes en mathématiques exigeantes, tandis que SimpleQA Verified le place dans le premier tiers pour les réponses factuelles vérifiables. Son principal avantage pratique reste son positionnement très économique : sa tarification se situe 77% sous la moyenne des LLM similaires et environ 12,1 fois sous celle des modèles frontière.

Limites et points d'attention. Les classements Arena text placent le modèle dans la partie basse des 200 modèles évalués, malgré des résultats spécialisés plus convaincants. Il se situe également près du bas du classement en résolution de problèmes d’échecs. FrontierMath, consacré aux mathématiques de recherche très difficiles, constitue sa faiblesse la plus nette, avec un score nul. La fenêtre de 131 072 tokens repose sur YaRN, le contexte natif étant limité à 32 768 tokens. Qwen3 235B A22B convient surtout aux usages multilingues, au raisonnement scientifique et mathématique, ainsi qu’aux déploiements sensibles au coût et nécessitant des poids ouverts.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.