DeepSeek VL2 Small

Sorti le 13 décembre 2024, DeepSeek VL2 Small est un modèle vision-langage de DeepSeek aujourd’hui ancien à l’échelle de l’IA. Cette variante de 16 milliards de paramètres appartient à une série fondée sur une architecture Mixture-of-Experts et s’appuie sur DeepSeekMoE-16B.

Sorti le 13 décembre 2024, DeepSeek VL2 Small est un modèle vision-langage de DeepSeek aujourd’hui ancien à l’échelle de l’IA. Cette variante de 16 milliards de paramètres appartient à une série fondée sur une architecture Mixture-of-Experts et s’appuie sur DeepSeekMoE-16B.

Son positionnement couvre l’analyse conjointe du texte et des images : question-réponse visuelle, OCR, compréhension de documents, tableaux et graphiques, ainsi que localisation d’éléments dans une image. L’inférence accepte une ou plusieurs images, avec un traitement qui varie selon leur nombre.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
Licencedeepseek
Date de sortie13 décembre 2024
Multimodaloui
Paramètres16 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQA92,3 %17ᵉ / 26llm-statsAuto-déclaré
ChartQA84,5 %15ᵉ / 24llm-statsAuto-déclaré
OCRBench83,4 %18ᵉ / 22llm-statsAuto-déclaré
TextVQA83,4 %5ᵉ / 15llm-statsAuto-déclaré
MMBench80,3 %7ᵉ / 9llm-statsAuto-déclaré
AI2D80,0 %29ᵉ / 32llm-statsAuto-déclaré
MMBench-V1.179,3 %16ᵉ / 18llm-statsAuto-déclaré
InfoVQA75,8 %4ᵉ / 9llm-statsAuto-déclaré
RealWorldQA65,4 %24ᵉ / 25llm-statsAuto-déclaré
MMT-Bench62,9 %3ᵉ / 4llm-statsAuto-déclaré
MathVista60,7 %26ᵉ / 38llm-statsAuto-déclaré
MMStar57,0 %21ᵉ / 22llm-statsAuto-déclaré
MMMU48,0 %57ᵉ / 61llm-statsAuto-déclaré
MME21,2 %2ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. À sa sortie, DeepSeek VL2 Small réunissait dans un même modèle plusieurs usages visuels concrets. Il peut extraire du texte par OCR, répondre à des questions sur une image, interpréter des documents structurés, des tableaux et des graphiques, puis relier une réponse à une zone visuelle précise. Son traitement multi-image applique un découpage dynamique jusqu’à deux images. À partir de trois images, il utilise directement un padding en 384×384. Son architecture Mixture-of-Experts repose sur DeepSeekMoE-16B, pour un total de 16 milliards de paramètres.

Limites et points d'attention. Près de deux ans après sa sortie, DeepSeek VL2 Small appartient à une génération très ancienne au rythme du secteur. Ses performances sont désormais largement dépassées par les modèles plus récents, et les modèles de cette période sont souvent retirés des catalogues des éditeurs. Ses poids ne sont pas ouverts et sa licence est propre à DeepSeek, ce qui limite l’accès au modèle. Enfin, les informations disponibles reposent sur une seule source de données concordante.


Sources des données : LLM-Stats (llm-stats.com).