DeepSeek VL2

Sorti le 13 décembre 2024, DeepSeek VL2 est un modèle vision-langage de DeepSeek. Désormais ancien à l’échelle de l’IA, il appartient à une génération probablement dépassée par les modèles récents et susceptible d’avoir quitté le catalogue de son éditeur.

Sorti le 13 décembre 2024, DeepSeek VL2 est un modèle vision-langage de DeepSeek. Désormais ancien à l’échelle de l’IA, il appartient à une génération probablement dépassée par les modèles récents et susceptible d’avoir quitté le catalogue de son éditeur.

Cette série Mixture-of-Experts repose sur DeepSeekMoE-27B et comprend trois variantes : DeepSeek-VL2-Tiny, DeepSeek-VL2-Small et DeepSeek-VL2, principalement différenciées par leur LLM de base. La version principale compte 27 milliards de paramètres et accepte un contexte de 129 280 tokens.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
Licencedeepseek
Date de sortie13 décembre 2024
Multimodaloui
Paramètres27 milliards
Fenêtre de contexte129 280 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQA93,3 %11ᵉ / 26llm-statsAuto-déclaré
ChartQA86,0 %11ᵉ / 24llm-statsAuto-déclaré
TextVQA84,2 %4ᵉ / 15llm-statsAuto-déclaré
AI2D81,4 %28ᵉ / 32llm-statsAuto-déclaré
OCRBench81,1 %20ᵉ / 22llm-statsAuto-déclaré
MMBench79,6 %8ᵉ / 9llm-statsAuto-déclaré
MMBench-V1.179,2 %17ᵉ / 18llm-statsAuto-déclaré
InfoVQA78,1 %3ᵉ / 9llm-statsAuto-déclaré
RealWorldQA68,4 %23ᵉ / 25llm-statsAuto-déclaré
MMT-Bench63,6 %1ᵉ / 4llm-statsAuto-déclaré
MathVista62,8 %23ᵉ / 38llm-statsAuto-déclaré
MMStar61,3 %20ᵉ / 22llm-statsAuto-déclaré
MMMU51,1 %55ᵉ / 61llm-statsAuto-déclaré
MME22,5 %1ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. DeepSeek VL2 réunit traitement du langage et analyse visuelle dans une même architecture. Ses usages couvrent la question-réponse visuelle, l’OCR, la compréhension de documents, de tableaux et de graphiques, ainsi que le visual grounding, qui consiste à relier une réponse à une zone précise d’une image. Le modèle prend aussi en charge des conversations contenant une ou plusieurs images. Sa fenêtre de 129 280 tokens constitue un atout concret pour traiter des échanges longs ou des contenus documentaires volumineux. Les trois variantes offrent par ailleurs plusieurs formats reposant sur la même famille technique.

Limites et points d'attention. DeepSeek VL2 accuse désormais un âge important dans un secteur où les générations se succèdent rapidement. Ses performances sont probablement largement dépassées par celles des modèles vision-langage actuels, et un modèle de cette ancienneté est souvent retiré du catalogue de son éditeur. Ses poids ne sont pas ouverts, malgré une licence désignée comme « deepseek », ce qui limite l’accès direct au modèle et la possibilité de le modifier librement. Son architecture de 27 milliards de paramètres implique également un modèle substantiel, sans en faire une solution légère.


Sources des données : LLM-Stats (llm-stats.com).