royokong/e5-v
Publié par royokong le 17 juillet 2024, e5-v est un modèle d’embedding multimodal de 8 milliards de paramètres, tous actifs. Affiné à partir de lmms-lab/llama3-llava-next-8b, il encode le texte et les images sous forme de vecteurs denses uniques de 4 096 dimensions.