Qwen 3.6 Max

Qwen 3.6 Max est un LLM publié par Qwen le 20 avril 2026. À sa sortie, il figurait dans le top 12 % des 49 LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat.

Qwen 3.6 Max est un LLM publié par Qwen le 20 avril 2026. À sa sortie, il figurait dans le top 12 % des 49 LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat.

Son profil se distingue par des résultats élevés en sciences, en mathématiques de niveau lycée et en résolution de bugs logiciels. Les évaluations en mathématiques de recherche et en connaissances factuelles révèlent un modèle polyvalent, avec des écarts sensibles selon la difficulté des tâches.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurQwen
Poids▫ n.d.
Date de sortie20 avril 2026

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: OTIS Mock AIME 2024-202591,1 %11ᵉ / 64epoch✅ Mesuré
Epoch: GPQA diamond89,1 %10ᵉ / 85epoch✅ Mesuré
Epoch: SWE-Bench verified76,7 %2ᵉ / 15epoch✅ Mesuré
Epoch: SimpleQA Verified56,9 %5ᵉ / 26epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public50,0 %5ᵉ / 33epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private23,1 %8ᵉ / 32epoch✅ Mesuré
Epoch: Chess Puzzles17,0 %16ᵉ / 20epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Private4,2 %10ᵉ / 25epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-2025-07-01-Public0,0 %1ᵉ / 15epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: OTIS Mock AIME 2024-2025

▶ Qwen 3.6 Max91 %

Epoch: GPQA diamond

▶ Qwen 3.6 Max89 %

Notre analyse

Forces. Qwen 3.6 Max obtient 89 % sur GPQA diamond (questions scientifiques de niveau doctorat) et intègre le top 10 du classement. Il atteint aussi 91 % sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée). Sur SWE-Bench verified (résolution de vrais bugs logiciels GitHub), son score de 77 % lui vaut de partager la deuxième place avec un autre modèle. Ce benchmark est toutefois plafonné et départage mal les meilleurs participants. Le modèle se classe également dans le top 10 sur les deux versions de FrontierMath, consacrées aux mathématiques de recherche très difficiles.

Limites et points d'attention. Le score de 57 % sur SimpleQA Verified montre une marge importante sur les questions factuelles vérifiables, malgré une cinquième place sur 26. FrontierMath Private constitue l'épreuve la plus difficile, avec 23 %. Sur FrontierMath Public, Qwen 3.6 Max partage la cinquième place avec un autre modèle, mais le plafonnement du benchmark limite la portée de cette position. Son profil convient surtout aux tâches scientifiques, mathématiques et logicielles, avec une vérification complémentaire des réponses factuelles.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.