Qwen: Qwen-Turbo
Publié par Qwen le 1er février 2025, Qwen-Turbo est déjà un modèle ancien à l’échelle de l’IA. Environ un an après sa sortie, il appartient à une génération probablement dépassée, dont les modèles sont souvent retirés des catalogues au profit de versions plus récentes.
Publié par Qwen le 1er février 2025, Qwen-Turbo est déjà un modèle ancien à l’échelle de l’IA. Environ un an après sa sortie, il appartient à une génération probablement dépassée, dont les modèles sont souvent retirés des catalogues au profit de versions plus récentes.
Sa caractéristique la plus marquante reste sa fenêtre de contexte de 1 million de tokens, adaptée au traitement de volumes de texte particulièrement importants. Ses connaissances s’étendent jusqu’au 31 mars 2025. À sa sortie, ses résultats en sciences le plaçaient dans le top 51 % des LLM de sa génération, soit près du milieu du classement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | ▫ n.d. |
| Date de sortie | 1 février 2025 |
| Connaissances jusqu'à | 2025-03-31 |
| Multimodal | non |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: MATH level 5 | 56,2 % | 23ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 41,8 % | 56ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 6,1 % | 45ᵉ / 64 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: MATH level 5
Epoch: GPQA diamond
Notre analyse
Forces. Qwen-Turbo se distingue d’abord par sa fenêtre de contexte de 1 million de tokens, un format conçu pour conserver une grande quantité d’informations au sein d’une même requête. Parmi les évaluations disponibles, MATH level 5 constitue son résultat le plus solide : le modèle se situe en milieu de tableau sur des problèmes mathématiques difficiles. À sa sortie, son classement sur GPQA diamond (questions scientifiques de niveau doctorat) le plaçait près de la médiane des 63 LLM de sa génération. Il offrait donc un niveau scientifique représentatif de son époque, sans appartenir au groupe de tête.
Limites et points d’attention. Les résultats actuels situent Qwen-Turbo dans la partie basse du classement sur GPQA diamond. Sa faiblesse est encore plus nette sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée), où il figure parmi les modèles les moins performants évalués. Son score plus convenable sur MATH level 5 ne se traduit donc pas par une maîtrise homogène du raisonnement mathématique. Après environ un an, durée très longue dans ce secteur, ses performances sont largement dépassées par les générations récentes, et les modèles de cet âge sont souvent retirés des catalogues des éditeurs.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.