DeepSeek R1 Distill Llama 8B
Publié par DeepSeek le 20 janvier 2025, DeepSeek R1 Distill Llama 8B est déjà ancien à l’échelle de l’IA. Ses performances doivent donc être replacées face aux modèles de sa période, alors qu’il est probablement dépassé et que les modèles de cet âge sont souvent retirés des catalogues.
Publié par DeepSeek le 20 janvier 2025, DeepSeek R1 Distill Llama 8B est déjà ancien à l’échelle de l’IA. Ses performances doivent donc être replacées face aux modèles de sa période, alors qu’il est probablement dépassé et que les modèles de cet âge sont souvent retirés des catalogues.
Ce LLM dense de 8 milliards de paramètres repose sur Llama-3.1-8B. Sa distillation à partir de DeepSeek-R1, complétée par un fine-tuning sur des échantillons générés par ce dernier, vise à transférer ses schémas de raisonnement vers un modèle plus petit. Ses poids sont proposés sous licence MIT, avec usage commercial autorisé.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 20 janvier 2025 |
| Multimodal | non |
| Paramètres | 8 milliards |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MATH-500 | 89,1 % | 28ᵉ / 31 | llm-stats | Auto-déclaré |
| AIME 2024 | 80,0 % | 27ᵉ / 52 | llm-stats | Auto-déclaré |
| GPQA | 49,0 % | 166ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench | 39,6 % | 49ᵉ / 72 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. À sa sortie, DeepSeek R1 Distill Llama 8B se situait dans le top 51% des 59 LLM de sa génération sur GPQA, soit juste dans la moitié supérieure pour ce benchmark. Son principal intérêt tient à son positionnement technique : condenser des schémas de raisonnement issus de DeepSeek-R1 dans une architecture dense de 8 milliards de paramètres fondée sur Llama-3.1-8B. Sa licence MIT autorise l’exploitation commerciale des poids. Le modèle s’utilise selon une logique proche des modèles Llama ou Qwen, avec ses configurations et tokenizers légèrement modifiés conservés tels quels.
Limites et points d'attention. Environ un an après sa sortie, ses performances sont largement dépassées à l’échelle du renouvellement actuel des LLM, et un modèle de cet âge n’est souvent plus proposé au catalogue de son éditeur. Son classement GPQA d’origine était déjà intermédiaire plutôt que dominant parmi les modèles contemporains. Ses connaissances s’arrêtent au 31 juillet 2024. L’usage recommandé impose aussi des choix précis : une température comprise entre 0.5 et 0.7, aucun prompt système et, pour les problèmes mathématiques, des consignes explicites placées dans le prompt utilisateur.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).