Qwen: Qwen-Turbo

Publié par Qwen le 1er février 2025, Qwen-Turbo est déjà un modèle ancien à l’échelle de l’IA. Environ un an après sa sortie, il appartient à une génération probablement dépassée, dont les modèles sont souvent retirés des catalogues au profit de versions plus récentes.

Publié par Qwen le 1er février 2025, Qwen-Turbo est déjà un modèle ancien à l’échelle de l’IA. Environ un an après sa sortie, il appartient à une génération probablement dépassée, dont les modèles sont souvent retirés des catalogues au profit de versions plus récentes.

Sa caractéristique la plus marquante reste sa fenêtre de contexte de 1 million de tokens, adaptée au traitement de volumes de texte particulièrement importants. Ses connaissances s’étendent jusqu’au 31 mars 2025. À sa sortie, ses résultats en sciences le plaçaient dans le top 51 % des LLM de sa génération, soit près du milieu du classement.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids▫ n.d.
Date de sortie1 février 2025
Connaissances jusqu'à2025-03-31
Multimodalnon
Fenêtre de contexte1 000 000 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: MATH level 556,2 %23ᵉ / 59epoch✅ Mesuré
Epoch: GPQA diamond41,8 %56ᵉ / 85epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20256,1 %45ᵉ / 64epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: MATH level 5

GPT-598 %
▶ Qwen-Turbo56 %

Epoch: GPQA diamond

▶ Qwen-Turbo42 %
Hermes 2 Theta Llama-3 …37 %

Notre analyse

Forces. Qwen-Turbo se distingue d’abord par sa fenêtre de contexte de 1 million de tokens, un format conçu pour conserver une grande quantité d’informations au sein d’une même requête. Parmi les évaluations disponibles, MATH level 5 constitue son résultat le plus solide : le modèle se situe en milieu de tableau sur des problèmes mathématiques difficiles. À sa sortie, son classement sur GPQA diamond (questions scientifiques de niveau doctorat) le plaçait près de la médiane des 63 LLM de sa génération. Il offrait donc un niveau scientifique représentatif de son époque, sans appartenir au groupe de tête.

Limites et points d’attention. Les résultats actuels situent Qwen-Turbo dans la partie basse du classement sur GPQA diamond. Sa faiblesse est encore plus nette sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée), où il figure parmi les modèles les moins performants évalués. Son score plus convenable sur MATH level 5 ne se traduit donc pas par une maîtrise homogène du raisonnement mathématique. Après environ un an, durée très longue dans ce secteur, ses performances sont largement dépassées par les générations récentes, et les modèles de cet âge sont souvent retirés des catalogues des éditeurs.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.