Qwen3-Max-Instruct

Publié le 24 septembre 2025 par Qwen, Qwen3-Max-Instruct est un grand modèle de langage qui se distingue surtout en mathématiques et dans le traitement de questions factuelles vérifiables. À sa sortie, ses résultats scientifiques le plaçaient dans le haut du panier des LLM de sa…

Publié le 24 septembre 2025 par Qwen, Qwen3-Max-Instruct est un grand modèle de langage qui se distingue surtout en mathématiques et dans le traitement de questions factuelles vérifiables. À sa sortie, ses résultats scientifiques le plaçaient dans le haut du panier des LLM de sa génération.

Son profil reste contrasté. Le modèle obtient de solides résultats sur les problèmes mathématiques difficiles et les questions scientifiques, mais échoue presque totalement dans la résolution de problèmes d’échecs. Cette spécialisation nette constitue le principal enseignement de ses évaluations.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurQwen
Poids▫ n.d.
Date de sortie24 septembre 2025

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: MATH level 597,1 %5ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-202573,3 %22ᵉ / 64epoch✅ Mesuré
Epoch: GPQA diamond72,6 %29ᵉ / 85epoch✅ Mesuré
Epoch: SimpleQA Verified67,5 %3ᵉ / 26epoch✅ Mesuré
Epoch: Chess Puzzles4,0 %20ᵉ / 20epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: MATH level 5

GPT-598 %
▶ Qwen3-Max-Instruct97 %

Epoch: OTIS Mock AIME 2024-2025

▶ Qwen3-Max-Instruct73 %

Notre analyse

Forces. Qwen3-Max-Instruct figure dans le top 10 de MATH level 5, avec une cinquième place sur 59 modèles. Il se classe aussi troisième sur SimpleQA Verified, qui évalue les réponses à des questions factuelles vérifiables. À sa sortie, son résultat sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat, le situait dans le top 22 % des 55 LLM de sa génération. Ces performances dessinent un modèle solide pour les tâches mathématiques exigeantes, les connaissances scientifiques avancées et la restitution de faits précis.

Limites et points d'attention. Sur le classement général de GPQA diamond, Qwen3-Max-Instruct occupe seulement la 29e place sur 85 malgré un score de 73 %. Sur OTIS Mock AIME 2024-2025, il partage la 22e place avec un autre modèle. Ce benchmark plafonné départage mal les concurrents et son score de 73 % reste peu discriminant. La faiblesse la plus marquée concerne Chess Puzzles : avec 4 %, le modèle termine dernier des 20 participants. Il reste donc pertinent pour les mathématiques, les sciences et les questions factuelles, mais pas pour la résolution de problèmes d’échecs.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.