DeepSeek R1 Zero

Sorti le 20 janvier 2025, DeepSeek R1 Zero est déjà ancien à l’échelle de l’IA. Ce LLM de DeepSeek se distinguait alors par un entraînement de raisonnement fondé sur l’apprentissage par renforcement à grande échelle, appliqué directement à DeepSeek-V3-Base sans fine-tuning supervisé…

Sorti le 20 janvier 2025, DeepSeek R1 Zero est déjà ancien à l’échelle de l’IA. Ce LLM de DeepSeek se distinguait alors par un entraînement de raisonnement fondé sur l’apprentissage par renforcement à grande échelle, appliqué directement à DeepSeek-V3-Base sans fine-tuning supervisé préalable.

Le modèle compte 671 milliards de paramètres au total, dont 37 milliards activés. Sa fenêtre de contexte atteint 163 840 tokens et ses connaissances s’arrêtent au 31 juillet 2024. Ses poids ouverts sous licence MIT autorisent l’usage commercial.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie20 janvier 2025
Multimodalnon
Paramètres671 milliards
Fenêtre de contexte163 840 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MATH-50095,9 %16ᵉ / 31llm-statsAuto-déclaré
AIME 202486,7 %13ᵉ / 52llm-statsAuto-déclaré
GPQA73,3 %104ᵉ / 219llm-statsAuto-déclaré
LiveCodeBench50,0 %44ᵉ / 72llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. À sa sortie, DeepSeek R1 Zero se plaçait dans le top 15% des 59 LLM de sa génération sur GPQA, un benchmark consacré aux questions scientifiques difficiles. Ce résultat le situait dans le haut du panier de son époque pour le raisonnement évalué par ce test. Son entraînement sans fine-tuning supervisé préalable constitue sa principale particularité technique. Le modèle développe des comportements d’auto-vérification, de réflexion et de production de longues chaînes de pensée. L’activation de 37 milliards de paramètres sur 671 milliards au total caractérise également son fonctionnement.

Limites et points d’attention. Environ un an après sa sortie, DeepSeek R1 Zero appartient déjà à une génération ancienne, dont les performances sont largement dépassées par les modèles plus récents et qui est souvent retirée du catalogue de l’éditeur. Ses sorties peuvent souffrir de répétitions sans fin, d’une faible lisibilité et d’un mélange de langues. La production de longues chaînes de pensée ne garantit donc pas une réponse claire ou stable. Enfin, ses connaissances s’arrêtent au 31 juillet 2024, ce qui exclut les événements et informations ultérieurs.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).