qwen-plus-2025-01-25

qwen-plus-2025-01-25 est un LLM d’Alibaba Cloud et de la Qwen Team, sorti le 8 septembre 2025. Il se distingue par une fenêtre de contexte de 1 000 000 tokens, adaptée aux volumes de texte particulièrement importants.

qwen-plus-2025-01-25 est un LLM d’Alibaba Cloud et de la Qwen Team, sorti le 8 septembre 2025. Il se distingue par une fenêtre de contexte de 1 000 000 tokens, adaptée aux volumes de texte particulièrement importants.

Son positionnement tarifaire est très économique : sa tarification se situe 88% sous la moyenne des LLM similaires et environ 21.2 fois sous celle des modèles frontière. Ses connaissances couvrent les informations disponibles jusqu’au 31 mars 2025.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids▫ n.d.
Date de sortie8 septembre 2025
Connaissances jusqu'à2025-03-31
Multimodalnon
Fenêtre de contexte1 000 000 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)97,0 %100ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)91,0 %71ᵉ / 140benchable✅ Mesuré
Benchable : Reasoning (Baseline)86,0 %61ᵉ / 155benchable✅ Mesuré
Benchable : Coding (Baseline)84,0 %96ᵉ / 162benchable✅ Mesuré
Epoch: MATH level 565,3 %20ᵉ / 59epoch✅ Mesuré
Benchable : Instruction Following (Baseline)61,0 %83ᵉ / 163benchable✅ Mesuré
Epoch: GPQA diamond48,1 %46ᵉ / 85epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-202517,8 %37ᵉ / 64epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private1,7 %27ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public0,0 %17ᵉ / 33epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ qwen-plus-2025-01-25100 %

Benchable : Ethics (Baseline)

▶ qwen-plus-2025-01-25100 %
command-r-plus-08-202499 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Alibaba Cloud Int.0,26 $0,78 $n.d.
Alibaba Cloud Int.0,26 $0,78 $0,052 $

Prix en dollars US par million de tokens.

Sa tarification se situe 88 % en dessous de la moyenne des LLM similaires, et 21,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,02 $
Latence moyenne par benchmark — Benchable4 min 34 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. La fenêtre de contexte de 1 000 000 tokens constitue son principal avantage pour les tâches qui exigent de traiter de très longs contenus. Sur Benchable, qwen-plus-2025-01-25 atteint le plafond des tests Ethics et Hallucinations. Il partage toutefois ces résultats avec respectivement 71 et 45 autres modèles. Les scores bruts restent également élevés en Email Classification, Mathematics et Reasoning. Son coût réduit renforce son intérêt pour les charges volumineuses et les usages sensibles au prix.

Limites et points d’attention. Les baselines Benchable sont plafonnées et départagent mal les modèles. En General Knowledge, le modèle partage seulement la 47e place malgré un score maximal. Email Classification se situe en retrait du classement, tandis que Mathematics et Reasoning occupent des positions intermédiaires. À sa sortie, GPQA diamond le plaçait dans le top 51% des 55 LLM de sa génération, soit près du milieu du groupe. Il convient surtout aux usages qui privilégient une très grande capacité de contexte et un faible coût plutôt qu’un positionnement de premier plan dans les classements.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).