DeepSeek-V2.5

DeepSeek-V2.5 est un LLM de DeepSeek sorti le 8 mai 2024. Près de deux ans plus tard, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles haut de gamme plus récents et souvent retirée des catalogues.

DeepSeek-V2.5 est un LLM de DeepSeek sorti le 8 mai 2024. Près de deux ans plus tard, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par les modèles haut de gamme plus récents et souvent retirée des catalogues.

Cette mise à niveau réunit les capacités générales de DeepSeek-V2-Chat et le codage de DeepSeek-Coder-V2-Instruct. Ses 236 milliards de paramètres ont mobilisé 1,8 × 10²⁴ FLOP, soit environ 497 000 heures-GPU H100, l’équivalent de 230 GPU H100 pendant trois mois. Sa fenêtre de contexte atteint 128 000 tokens.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
Licencedeepseek
Date de sortie8 mai 2024
Multimodalnon
Paramètres236 milliards
Fenêtre de contexte8 192 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
GSM8k95,1 %10ᵉ / 47llm-statsAuto-déclaré
MT-Bench90,2 %3ᵉ / 12llm-statsAuto-déclaré
HumanEval89,0 %15ᵉ / 65llm-statsAuto-déclaré
BBH84,3 %5ᵉ / 12llm-statsAuto-déclaré
AlignBench80,4 %2ᵉ / 4llm-statsAuto-déclaré
MMLU80,4 %58ᵉ / 98llm-statsAuto-déclaré
Arena Hard76,2 %8ᵉ / 26llm-statsAuto-déclaré
MATH74,7 %29ᵉ / 70llm-statsAuto-déclaré
Aider72,2 %1ᵉ / 4llm-statsAuto-déclaré
AlpacaEval 2.050,5 %3ᵉ / 4llm-statsAuto-déclaré
SWE-Bench Verified16,8 %101ᵉ / 102llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement1,8 × 10²⁴ FLOP
Jeu de donnéesGitHub,Common Crawl
PaysChina

Notre analyse

Forces. À sa sortie, DeepSeek-V2.5 se plaçait dans le top 25% des 12 LLM de sa génération sur MATH, ce qui le situait dans le haut du panier pour le raisonnement mathématique. Son positionnement hybride associe conversation généraliste et génération de code. Le modèle est également optimisé pour l’écriture, le suivi d’instructions et un meilleur alignement avec les préférences humaines. Il prend en charge le function calling, les sorties JSON et la complétion FIM. L’inférence est compatible avec Hugging Face Transformers et vLLM, au moyen d’un template de chat actualisé et d’un message système optionnel.

Limites et points d'attention. Près de deux ans après sa sortie, ses performances sont largement dépassées par celles des générations récentes, et une version de cet âge n’est souvent plus proposée au catalogue de son éditeur. Ses connaissances s’arrêtent au 31 juillet 2024, ce qui limite son intérêt pour les informations ultérieures. Ses poids ne sont pas ouverts sous sa licence DeepSeek. L’effort d’entraînement reste néanmoins marquant : environ 497 000 heures-GPU H100, soit 230 GPU H100 fonctionnant pendant trois mois, pour un modèle de 236 milliards de paramètres.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Epoch AI (epoch.ai), CC-BY-4.0.