DeepSeek-R1-0528
DeepSeek-R1-0528 est un LLM open weights de DeepSeek, publié le 28 mai 2025 sous licence MIT, avec usage commercial autorisé. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et doit être comparé aux modèles de sa période plutôt qu’aux références…
DeepSeek-R1-0528 est un LLM open weights de DeepSeek, publié le 28 mai 2025 sous licence MIT, avec usage commercial autorisé. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et doit être comparé aux modèles de sa période plutôt qu’aux références actuelles.
Ce modèle MoE fondé sur DeepSeek-V3-Base réunit 671 milliards de paramètres, dont 37 milliards activés. Son entraînement combine démarrage à froid, deux étapes d’apprentissage par renforcement et deux étapes de SFT, pour le raisonnement comme pour les tâches générales. Il se distingue aussi par une tarification très économique.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 28 mai 2025 |
| Multimodal | non |
| Paramètres | 671 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MMLU-Redux | 93,4 % | 10ᵉ / 48 | llm-stats | Auto-déclaré |
| SimpleQA | 92,3 % | 4ᵉ / 45 | llm-stats | Auto-déclaré |
| AIME 2024 | 91,4 % | 7ᵉ / 52 | llm-stats | Auto-déclaré |
| AIME 2025 | 87,5 % | 50ᵉ / 108 | llm-stats | Auto-déclaré |
| MMLU-Pro | 85,0 % | 17ᵉ / 125 | llm-stats | Auto-déclaré |
| GPQA | 81,0 % | 73ᵉ / 219 | llm-stats | Auto-déclaré |
| HMMT 2025 | 79,4 % | 25ᵉ / 33 | llm-stats | Auto-déclaré |
| LiveCodeBench | 73,3 % | 17ᵉ / 72 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 71,6 % | 6ᵉ / 22 | llm-stats | Auto-déclaré |
| CodeForces | 64,3 % | 14ᵉ / 16 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 44,6 % | 89ᵉ / 102 | llm-stats | Auto-déclaré |
| BrowseComp-zh | 35,7 % | 13ᵉ / 13 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 30,5 % | 34ᵉ / 34 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 17,7 % | 61ᵉ / 89 | llm-stats | Auto-déclaré |
| BrowseComp | 8,9 % | 57ᵉ / 57 | llm-stats | Auto-déclaré |
| Terminal-Bench | 5,7 % | 25ᵉ / 25 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 95ᵉ | DeepSeek-V3.2 (Thinking) | 1423 |
| 96ᵉ | DeepSeek-V3.2-Exp | 1423 |
| 97ᵉ | DeepSeek-R1-0528 | 1422 |
| 98ᵉ | grok-4-fast-chat | 1421 |
| 99ᵉ | ernie-5.0-preview-1022 | 1419 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,5 $ | 2,15 $ | 0,35 $ |
| NovitaAI | 0,7 $ | 2,5 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 76 % en dessous de la moyenne des LLM similaires, et 11 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,17 $ |
| Latence moyenne par benchmark — Benchable | 53 min 24 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, DeepSeek-R1-0528 figurait dans le top 10% des LLM de sa génération sur GPQA. Ses résultats Baseline sont particulièrement solides en connaissances générales, en éthique et en classification d’e-mails. Le raisonnement constitue également un point fort, tandis que le code et les mathématiques restent à un niveau élevé. Sa fenêtre de contexte atteint 163 840 tokens et ses connaissances couvrent les informations jusqu’au 31 mars 2025. Le modèle est accessible par le service de chat de DeepSeek, une API compatible OpenAI et une exécution locale. Son coût se situe 75% sous la moyenne des LLM similaires et environ onze fois sous celui des modèles frontière.
Limites et points d'attention. Malgré des scores Baseline élevés, ses classements relatifs sont moins dominants, souvent éloignés des toutes premières places. Dans l’Arena text, il se situe en milieu de tableau, avec un écart notable face au modèle en tête. Son ancienneté est désormais très importante dans un secteur qui évolue rapidement : ses performances sont aujourd’hui largement dépassées et ce type de version est souvent retiré du catalogue de l’éditeur. Son architecture de 671 milliards de paramètres reste lourde pour une exécution locale, même si le fonctionnement MoE n’en active que 37 milliards. Transformers n’est pas directement pris en charge.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).