DeepSeek-R1

Sorti le 28 mai 2025, DeepSeek-R1 est déjà ancien à l’échelle de l’IA et désormais probablement dépassé. Ce LLM de raisonnement de DeepSeek repose sur une architecture MoE de 671 milliards de paramètres, dont 37 milliards actifs, avec une fenêtre de contexte de 163 840 tokens. Sa licence…

Sorti le 28 mai 2025, DeepSeek-R1 est déjà ancien à l’échelle de l’IA et désormais probablement dépassé. Ce LLM de raisonnement de DeepSeek repose sur une architecture MoE de 671 milliards de paramètres, dont 37 milliards actifs, avec une fenêtre de contexte de 163 840 tokens. Sa licence MIT autorise l’usage commercial de ses poids ouverts.

Issu de DeepSeek-V3-Base, il combine données de cold-start, deux étapes d’apprentissage par renforcement et deux étapes de SFT. Son entraînement représente 3,5 × 10²⁴ FLOP, soit environ 450 GPU H100 mobilisés pendant trois mois, pour un coût estimé à 6,8 millions de dollars.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie20 janvier 2025
Multimodalnon
Paramètres671 milliards
Paramètres actifs37 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index20.1102ᵉ / 137
Math Index76.019ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nova 2.0 Pro Preview21.8
▶ DeepSeek-R120.1

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ DeepSeek-R176.0

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
128ᵉClaude Sonnet 41399
129ᵉQwen3-235B-A22B-Thinking-25071399
130ᵉDeepSeek-R11398
131ᵉQwen: Qwen3.5-Flash1397
132ᵉDeepSeek-V3 03241396

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,07 $
Latence moyenne par benchmark — Benchable23 min 31 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement3,5 × 10²⁴ FLOP
Taille du jeu d'entraînement1,5 × 10¹³
Jeu de donnéesUnspecified unreleased
Coût d'entraînement estimé≈ 6 770 000 $ (USD 2023)
PaysChina

Notre analyse

Forces. À sa sortie, DeepSeek-R1 figurait dans le top 12% des LLM de sa génération sur GPQA diamond. Il reste particulièrement solide en mathématiques, avec un classement top 10 sur MATH level 5 et une bonne position au Math Index. Il atteint aussi la première place sur les tests de suivi d’instructions et de classification d’e-mails. Ses mécanismes de chaîne de pensée, d’auto-vérification et de réflexion ciblent les tâches de mathématiques, de code et de raisonnement. Son tarif est très économique, inférieur de 32% à la moyenne des LLM similaires et environ 4,1 fois moins élevé que celui des modèles frontière. Il est accessible par chat, par une API compatible OpenAI ou localement.

Limites et points d’attention. Son Intelligence Index le place aujourd’hui dans le bas du classement, tandis que son rang dans l’Arena text reste éloigné de la tête. Les résultats en connaissances générales, en éthique et sur les hallucinations affichent des scores élevés en valeur absolue, mais des positions faibles face aux autres modèles évalués. Près d’un an après sa sortie, ses performances sont largement dépassées à l’échelle du secteur et ce type de modèle est souvent retiré du catalogue de son éditeur. Son effort d’entraînement reste néanmoins marquant, avec environ 972 000 heures-GPU H100 et un coût estimé à 6,8 millions de dollars.


Sources des données : LLM-Stats (llm-stats.com) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).