DeepSeek-R1
Sorti le 28 mai 2025, DeepSeek-R1 est déjà ancien à l’échelle de l’IA et désormais probablement dépassé. Ce LLM de raisonnement de DeepSeek repose sur une architecture MoE de 671 milliards de paramètres, dont 37 milliards actifs, avec une fenêtre de contexte de 163 840 tokens. Sa licence…
Sorti le 28 mai 2025, DeepSeek-R1 est déjà ancien à l’échelle de l’IA et désormais probablement dépassé. Ce LLM de raisonnement de DeepSeek repose sur une architecture MoE de 671 milliards de paramètres, dont 37 milliards actifs, avec une fenêtre de contexte de 163 840 tokens. Sa licence MIT autorise l’usage commercial de ses poids ouverts.
Issu de DeepSeek-V3-Base, il combine données de cold-start, deux étapes d’apprentissage par renforcement et deux étapes de SFT. Son entraînement représente 3,5 × 10²⁴ FLOP, soit environ 450 GPU H100 mobilisés pendant trois mois, pour un coût estimé à 6,8 millions de dollars.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 20 janvier 2025 |
| Multimodal | non |
| Paramètres | 671 milliards |
| Paramètres actifs | 37 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 20.1 | 102ᵉ / 137 |
| Math Index | 76.0 | 19ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 128ᵉ | Claude Sonnet 4 | 1399 |
| 129ᵉ | Qwen3-235B-A22B-Thinking-2507 | 1399 |
| 130ᵉ | DeepSeek-R1 | 1398 |
| 131ᵉ | Qwen: Qwen3.5-Flash | 1397 |
| 132ᵉ | DeepSeek-V3 0324 | 1396 |
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,07 $ |
| Latence moyenne par benchmark — Benchable | 23 min 31 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 3,5 × 10²⁴ FLOP |
| Taille du jeu d'entraînement | 1,5 × 10¹³ |
| Jeu de données | Unspecified unreleased |
| Coût d'entraînement estimé | ≈ 6 770 000 $ (USD 2023) |
| Pays | China |
Notre analyse
Forces. À sa sortie, DeepSeek-R1 figurait dans le top 12% des LLM de sa génération sur GPQA diamond. Il reste particulièrement solide en mathématiques, avec un classement top 10 sur MATH level 5 et une bonne position au Math Index. Il atteint aussi la première place sur les tests de suivi d’instructions et de classification d’e-mails. Ses mécanismes de chaîne de pensée, d’auto-vérification et de réflexion ciblent les tâches de mathématiques, de code et de raisonnement. Son tarif est très économique, inférieur de 32% à la moyenne des LLM similaires et environ 4,1 fois moins élevé que celui des modèles frontière. Il est accessible par chat, par une API compatible OpenAI ou localement.
Limites et points d’attention. Son Intelligence Index le place aujourd’hui dans le bas du classement, tandis que son rang dans l’Arena text reste éloigné de la tête. Les résultats en connaissances générales, en éthique et sur les hallucinations affichent des scores élevés en valeur absolue, mais des positions faibles face aux autres modèles évalués. Près d’un an après sa sortie, ses performances sont largement dépassées à l’échelle du secteur et ce type de modèle est souvent retiré du catalogue de son éditeur. Son effort d’entraînement reste néanmoins marquant, avec environ 972 000 heures-GPU H100 et un coût estimé à 6,8 millions de dollars.
Sources des données : LLM-Stats (llm-stats.com) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).