DeepSeek-R1-0528

DeepSeek-R1-0528 est un LLM open weights de DeepSeek, publié le 28 mai 2025 sous licence MIT, avec usage commercial autorisé. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et doit être comparé aux modèles de sa période plutôt qu’aux références…

DeepSeek-R1-0528 est un LLM open weights de DeepSeek, publié le 28 mai 2025 sous licence MIT, avec usage commercial autorisé. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et doit être comparé aux modèles de sa période plutôt qu’aux références actuelles.

Ce modèle MoE fondé sur DeepSeek-V3-Base réunit 671 milliards de paramètres, dont 37 milliards activés. Son entraînement combine démarrage à froid, deux étapes d’apprentissage par renforcement et deux étapes de SFT, pour le raisonnement comme pour les tâches générales. Il se distingue aussi par une tarification très économique.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie28 mai 2025
Multimodalnon
Paramètres671 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MMLU-Redux93,4 %10ᵉ / 48llm-statsAuto-déclaré
SimpleQA92,3 %4ᵉ / 45llm-statsAuto-déclaré
AIME 202491,4 %7ᵉ / 52llm-statsAuto-déclaré
AIME 202587,5 %50ᵉ / 108llm-statsAuto-déclaré
MMLU-Pro85,0 %17ᵉ / 125llm-statsAuto-déclaré
GPQA81,0 %73ᵉ / 219llm-statsAuto-déclaré
HMMT 202579,4 %25ᵉ / 33llm-statsAuto-déclaré
LiveCodeBench73,3 %17ᵉ / 72llm-statsAuto-déclaré
Aider-Polyglot71,6 %6ᵉ / 22llm-statsAuto-déclaré
CodeForces64,3 %14ᵉ / 16llm-statsAuto-déclaré
SWE-Bench Verified44,6 %89ᵉ / 102llm-statsAuto-déclaré
BrowseComp-zh35,7 %13ᵉ / 13llm-statsAuto-déclaré
SWE-bench Multilingual30,5 %34ᵉ / 34llm-statsAuto-déclaré
Humanity's Last Exam17,7 %61ᵉ / 89llm-statsAuto-déclaré
BrowseComp8,9 %57ᵉ / 57llm-statsAuto-déclaré
Terminal-Bench5,7 %25ᵉ / 25llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
95ᵉDeepSeek-V3.2 (Thinking)1423
96ᵉDeepSeek-V3.2-Exp1423
97ᵉDeepSeek-R1-05281422
98ᵉgrok-4-fast-chat1421
99ᵉernie-5.0-preview-10221419

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,5 $2,15 $0,35 $
NovitaAI0,7 $2,5 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 76 % en dessous de la moyenne des LLM similaires, et 11 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,17 $
Latence moyenne par benchmark — Benchable53 min 24 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, DeepSeek-R1-0528 figurait dans le top 10% des LLM de sa génération sur GPQA. Ses résultats Baseline sont particulièrement solides en connaissances générales, en éthique et en classification d’e-mails. Le raisonnement constitue également un point fort, tandis que le code et les mathématiques restent à un niveau élevé. Sa fenêtre de contexte atteint 163 840 tokens et ses connaissances couvrent les informations jusqu’au 31 mars 2025. Le modèle est accessible par le service de chat de DeepSeek, une API compatible OpenAI et une exécution locale. Son coût se situe 75% sous la moyenne des LLM similaires et environ onze fois sous celui des modèles frontière.

Limites et points d'attention. Malgré des scores Baseline élevés, ses classements relatifs sont moins dominants, souvent éloignés des toutes premières places. Dans l’Arena text, il se situe en milieu de tableau, avec un écart notable face au modèle en tête. Son ancienneté est désormais très importante dans un secteur qui évolue rapidement : ses performances sont aujourd’hui largement dépassées et ce type de version est souvent retiré du catalogue de l’éditeur. Son architecture de 671 milliards de paramètres reste lourde pour une exécution locale, même si le fonctionnement MoE n’en active que 37 milliards. Transformers n’est pas directement pris en charge.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).