DeepSeek R1 Zero
Sorti le 20 janvier 2025, DeepSeek R1 Zero est déjà ancien à l’échelle de l’IA. Ce LLM de DeepSeek se distinguait alors par un entraînement de raisonnement fondé sur l’apprentissage par renforcement à grande échelle, appliqué directement à DeepSeek-V3-Base sans fine-tuning supervisé…
Sorti le 20 janvier 2025, DeepSeek R1 Zero est déjà ancien à l’échelle de l’IA. Ce LLM de DeepSeek se distinguait alors par un entraînement de raisonnement fondé sur l’apprentissage par renforcement à grande échelle, appliqué directement à DeepSeek-V3-Base sans fine-tuning supervisé préalable.
Le modèle compte 671 milliards de paramètres au total, dont 37 milliards activés. Sa fenêtre de contexte atteint 163 840 tokens et ses connaissances s’arrêtent au 31 juillet 2024. Ses poids ouverts sous licence MIT autorisent l’usage commercial.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 20 janvier 2025 |
| Multimodal | non |
| Paramètres | 671 milliards |
| Fenêtre de contexte | 163 840 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MATH-500 | 95,9 % | 16ᵉ / 31 | llm-stats | Auto-déclaré |
| AIME 2024 | 86,7 % | 13ᵉ / 52 | llm-stats | Auto-déclaré |
| GPQA | 73,3 % | 104ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench | 50,0 % | 44ᵉ / 72 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. À sa sortie, DeepSeek R1 Zero se plaçait dans le top 15% des 59 LLM de sa génération sur GPQA, un benchmark consacré aux questions scientifiques difficiles. Ce résultat le situait dans le haut du panier de son époque pour le raisonnement évalué par ce test. Son entraînement sans fine-tuning supervisé préalable constitue sa principale particularité technique. Le modèle développe des comportements d’auto-vérification, de réflexion et de production de longues chaînes de pensée. L’activation de 37 milliards de paramètres sur 671 milliards au total caractérise également son fonctionnement.
Limites et points d’attention. Environ un an après sa sortie, DeepSeek R1 Zero appartient déjà à une génération ancienne, dont les performances sont largement dépassées par les modèles plus récents et qui est souvent retirée du catalogue de l’éditeur. Ses sorties peuvent souffrir de répétitions sans fin, d’une faible lisibilité et d’un mélange de langues. La production de longues chaînes de pensée ne garantit donc pas une réponse claire ou stable. Enfin, ses connaissances s’arrêtent au 31 juillet 2024, ce qui exclut les événements et informations ultérieurs.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).