DeepSeek VL2 Tiny
Publié par DeepSeek le 13 décembre 2024, DeepSeek VL2 Tiny est un modèle vision-langage de 3 milliards de paramètres. Près de deux ans représentent une ancienneté très importante dans l’IA : cette génération est désormais probablement dépassée par les modèles plus récents.
Publié par DeepSeek le 13 décembre 2024, DeepSeek VL2 Tiny est un modèle vision-langage de 3 milliards de paramètres. Près de deux ans représentent une ancienneté très importante dans l’IA : cette génération est désormais probablement dépassée par les modèles plus récents.
Cette variante compacte de la série DeepSeek-VL2 repose sur une architecture Mixture-of-Experts dérivée de DeepSeekMoE-3B, avec 1.0 milliard de paramètres activés. Elle traite notamment la question-réponse visuelle, l’OCR, les documents, les tableaux, les graphiques et la localisation d’éléments dans une image.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts · usage commercial restreint (recherche / non commercial) |
| Licence | deepseek |
| Date de sortie | 13 décembre 2024 |
| Multimodal | oui |
| Paramètres | 3 milliards |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQA | 88,9 % | 20ᵉ / 26 | llm-stats | Auto-déclaré |
| ChartQA | 81,0 % | 20ᵉ / 24 | llm-stats | Auto-déclaré |
| OCRBench | 80,9 % | 21ᵉ / 22 | llm-stats | Auto-déclaré |
| TextVQA | 80,7 % | 7ᵉ / 15 | llm-stats | Auto-déclaré |
| AI2D | 71,6 % | 32ᵉ / 32 | llm-stats | Auto-déclaré |
| MMBench | 69,2 % | 9ᵉ / 9 | llm-stats | Auto-déclaré |
| MMBench-V1.1 | 68,3 % | 18ᵉ / 18 | llm-stats | Auto-déclaré |
| InfoVQA | 66,1 % | 7ᵉ / 9 | llm-stats | Auto-déclaré |
| RealWorldQA | 64,2 % | 25ᵉ / 25 | llm-stats | Auto-déclaré |
| MathVista | 53,6 % | 32ᵉ / 38 | llm-stats | Auto-déclaré |
| MMT-Bench | 53,2 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| MMStar | 45,9 % | 22ᵉ / 22 | llm-stats | Auto-déclaré |
| MMMU | 40,7 % | 60ᵉ / 61 | llm-stats | Auto-déclaré |
| MME | 19,1 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. DeepSeek VL2 Tiny réunit plusieurs tâches visuelles dans un modèle de 3 milliards de paramètres. Son architecture Mixture-of-Experts n’active que 1.0 milliard de paramètres lors du traitement, une caractéristique centrale de son positionnement compact. Le modèle accepte des conversations associées à une image unique ou à plusieurs images. Son traitement visuel applique un découpage dynamique jusqu’à deux images, puis un redimensionnement direct avec remplissage en 384×384 à partir de trois images. Cette polyvalence couvre aussi bien la lecture de texte que l’interprétation de documents structurés et la localisation visuelle.
Limites et points d’attention. Son âge pèse fortement sur sa pertinence actuelle : les modèles vision-langage de cette période sont aujourd’hui largement dépassés et souvent retirés des catalogues au profit de générations plus récentes. Le format Tiny implique en outre un positionnement compact plutôt qu’un modèle haut de gamme. Les poids ne sont pas ouverts, ce qui limite la réutilisation et l’adaptation indépendantes malgré la taille contenue du modèle. Enfin, la gestion de trois images ou plus abandonne le découpage dynamique au profit d’un remplissage direct en 384×384, créant une différence concrète de traitement selon le nombre d’images fournies.
Sources des données : LLM-Stats (llm-stats.com).