Qwen 3.6 Max
Qwen 3.6 Max est un LLM publié par Qwen le 20 avril 2026. À sa sortie, il figurait dans le top 12 % des 49 LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat.
Qwen 3.6 Max est un LLM publié par Qwen le 20 avril 2026. À sa sortie, il figurait dans le top 12 % des 49 LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat.
Son profil se distingue par des résultats élevés en sciences, en mathématiques de niveau lycée et en résolution de bugs logiciels. Les évaluations en mathématiques de recherche et en connaissances factuelles révèlent un modèle polyvalent, avec des écarts sensibles selon la difficulté des tâches.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Qwen |
| Poids | ▫ n.d. |
| Date de sortie | 20 avril 2026 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: OTIS Mock AIME 2024-2025 | 91,1 % | 11ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 89,1 % | 10ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: SWE-Bench verified | 76,7 % | 2ᵉ / 15 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 56,9 % | 5ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 50,0 % | 5ᵉ / 33 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 23,1 % | 8ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 17,0 % | 16ᵉ / 20 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Private | 4,2 % | 10ᵉ / 25 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-2025-07-01-Public | 0,0 % | 1ᵉ / 15 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: OTIS Mock AIME 2024-2025
Epoch: GPQA diamond
Notre analyse
Forces. Qwen 3.6 Max obtient 89 % sur GPQA diamond (questions scientifiques de niveau doctorat) et intègre le top 10 du classement. Il atteint aussi 91 % sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée). Sur SWE-Bench verified (résolution de vrais bugs logiciels GitHub), son score de 77 % lui vaut de partager la deuxième place avec un autre modèle. Ce benchmark est toutefois plafonné et départage mal les meilleurs participants. Le modèle se classe également dans le top 10 sur les deux versions de FrontierMath, consacrées aux mathématiques de recherche très difficiles.
Limites et points d'attention. Le score de 57 % sur SimpleQA Verified montre une marge importante sur les questions factuelles vérifiables, malgré une cinquième place sur 26. FrontierMath Private constitue l'épreuve la plus difficile, avec 23 %. Sur FrontierMath Public, Qwen 3.6 Max partage la cinquième place avec un autre modèle, mais le plafonnement du benchmark limite la portée de cette position. Son profil convient surtout aux tâches scientifiques, mathématiques et logicielles, avec une vérification complémentaire des réponses factuelles.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.