qwen-plus-2025-01-25
qwen-plus-2025-01-25 est un LLM d’Alibaba Cloud et de la Qwen Team, sorti le 8 septembre 2025. Il se distingue par une fenêtre de contexte de 1 000 000 tokens, adaptée aux volumes de texte particulièrement importants.
qwen-plus-2025-01-25 est un LLM d’Alibaba Cloud et de la Qwen Team, sorti le 8 septembre 2025. Il se distingue par une fenêtre de contexte de 1 000 000 tokens, adaptée aux volumes de texte particulièrement importants.
Son positionnement tarifaire est très économique : sa tarification se situe 88% sous la moyenne des LLM similaires et environ 21.2 fois sous celle des modèles frontière. Ses connaissances couvrent les informations disponibles jusqu’au 31 mars 2025.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | ▫ n.d. |
| Date de sortie | 8 septembre 2025 |
| Connaissances jusqu'à | 2025-03-31 |
| Multimodal | non |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 97,0 % | 100ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 91,0 % | 71ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 86,0 % | 61ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 84,0 % | 96ᵉ / 162 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 65,3 % | 20ᵉ / 59 | epoch | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 61,0 % | 83ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 48,1 % | 46ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 17,8 % | 37ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 1,7 % | 27ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 0,0 % | 17ᵉ / 33 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Hallucinations (Baseline)
Benchable : Ethics (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Alibaba Cloud Int. | 0,26 $ | 0,78 $ | n.d. |
| Alibaba Cloud Int. | 0,26 $ | 0,78 $ | 0,052 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 88 % en dessous de la moyenne des LLM similaires, et 21,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,02 $ |
| Latence moyenne par benchmark — Benchable | 4 min 34 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. La fenêtre de contexte de 1 000 000 tokens constitue son principal avantage pour les tâches qui exigent de traiter de très longs contenus. Sur Benchable, qwen-plus-2025-01-25 atteint le plafond des tests Ethics et Hallucinations. Il partage toutefois ces résultats avec respectivement 71 et 45 autres modèles. Les scores bruts restent également élevés en Email Classification, Mathematics et Reasoning. Son coût réduit renforce son intérêt pour les charges volumineuses et les usages sensibles au prix.
Limites et points d’attention. Les baselines Benchable sont plafonnées et départagent mal les modèles. En General Knowledge, le modèle partage seulement la 47e place malgré un score maximal. Email Classification se situe en retrait du classement, tandis que Mathematics et Reasoning occupent des positions intermédiaires. À sa sortie, GPQA diamond le plaçait dans le top 51% des 55 LLM de sa génération, soit près du milieu du groupe. Il convient surtout aux usages qui privilégient une très grande capacité de contexte et un faible coût plutôt qu’un positionnement de premier plan dans les classements.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).