DeepSeek-V2.5
DeepSeek-V2.5 est un LLM de DeepSeek sorti le 8 mai 2024. Près de deux ans plus tard, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles haut de gamme plus récents et souvent retirée des catalogues.
DeepSeek-V2.5 est un LLM de DeepSeek sorti le 8 mai 2024. Près de deux ans plus tard, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles haut de gamme plus récents et souvent retirée des catalogues.
Cette mise à niveau réunit les capacités générales de DeepSeek-V2-Chat et le codage de DeepSeek-Coder-V2-Instruct. Ses 236 milliards de paramètres ont mobilisé 1,8 × 10²⁴ FLOP, soit environ 497 000 heures-GPU H100, l’équivalent de 230 GPU H100 pendant trois mois. Sa fenêtre de contexte atteint 128 000 tokens.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts · usage commercial restreint (recherche / non commercial) |
| Licence | deepseek |
| Date de sortie | 8 mai 2024 |
| Multimodal | non |
| Paramètres | 236 milliards |
| Fenêtre de contexte | 8 192 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| GSM8k | 95,1 % | 10ᵉ / 47 | llm-stats | Auto-déclaré |
| MT-Bench | 90,2 % | 3ᵉ / 12 | llm-stats | Auto-déclaré |
| HumanEval | 89,0 % | 15ᵉ / 65 | llm-stats | Auto-déclaré |
| BBH | 84,3 % | 5ᵉ / 12 | llm-stats | Auto-déclaré |
| AlignBench | 80,4 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| MMLU | 80,4 % | 58ᵉ / 98 | llm-stats | Auto-déclaré |
| Arena Hard | 76,2 % | 8ᵉ / 26 | llm-stats | Auto-déclaré |
| MATH | 74,7 % | 29ᵉ / 70 | llm-stats | Auto-déclaré |
| Aider | 72,2 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| AlpacaEval 2.0 | 50,5 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 16,8 % | 101ᵉ / 102 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 1,8 × 10²⁴ FLOP |
| Jeu de données | GitHub,Common Crawl |
| Pays | China |
Notre analyse
Forces. À sa sortie, DeepSeek-V2.5 se plaçait dans le top 25% des 12 LLM de sa génération sur MATH, ce qui le situait dans le haut du panier pour le raisonnement mathématique. Son positionnement hybride associe conversation généraliste et génération de code. Le modèle est également optimisé pour l’écriture, le suivi d’instructions et un meilleur alignement avec les préférences humaines. Il prend en charge le function calling, les sorties JSON et la complétion FIM. L’inférence est compatible avec Hugging Face Transformers et vLLM, au moyen d’un template de chat actualisé et d’un message système optionnel.
Limites et points d'attention. Près de deux ans après sa sortie, ses performances sont largement dépassées par celles des générations récentes, et une version de cet âge n’est souvent plus proposée au catalogue de son éditeur. Ses connaissances s’arrêtent au 31 juillet 2024, ce qui limite son intérêt pour les informations ultérieures. Ses poids ne sont pas ouverts sous sa licence DeepSeek. L’effort d’entraînement reste néanmoins marquant : environ 497 000 heures-GPU H100, soit 230 GPU H100 fonctionnant pendant trois mois, pour un modèle de 236 milliards de paramètres.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Epoch AI (epoch.ai), CC-BY-4.0.