VAGOsolutions/SauerkrautLM-ColLFM2-450M-v0.1

Publié par VAGOsolutions le 20 décembre 2025, VAGOsolutions/SauerkrautLM-ColLFM2-450M-v0.1 est un modèle d’embedding de 451 millions de paramètres actifs, fondé sur LiquidAI/LFM2-VL-450M. Il produit des représentations multi-vecteurs visuelles de dimension 128 et reprend la licence…

Publié par VAGOsolutions le 20 décembre 2025, VAGOsolutions/SauerkrautLM-ColLFM2-450M-v0.1 est un modèle d’embedding de 451 millions de paramètres actifs, fondé sur LiquidAI/LFM2-VL-450M. Il produit des représentations multi-vecteurs visuelles de dimension 128 et reprend la licence publiée pour ce modèle de base.

Son encodeur visuel SigLIP2 traite directement les images de documents, sans OCR, tandis que les requêtes sont saisies sous forme de texte. Le modèle couvre l’anglais, l’allemand, le français, l’espagnol, l’italien et le portugais. Il sert à la recherche sémantique de documents visuels, au RAG multimodal, au calcul de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurVAGOsolutions
Poids🟢 Poids ouverts
Licencehttps://huggingface.co/LiquidAI/LFM2-VL-450M/blob/main/LICENSE
Date de sortie20 décembre 2025
Dimension du vecteur128
Représentationmulti-vecteur visuel
Paramètres451 millions
Paramètres actifs451 millions
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)74,3 %38ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le modèle est spécialisé dans la recherche visuelle de documents comprenant des mises en page complexes, des tableaux, des formulaires ou des graphiques. L’encodage direct des pages évite de faire dépendre la chaîne de traitement d’une étape préalable d’OCR. Les requêtes textuelles et les images de documents sont rapprochées par des scores de similarité, ce qui convient à la sélection de sources pour un système RAG multimodal. La prise en charge de six langues facilite la constitution d’un même moteur de recherche pour plusieurs corpus européens. La dimension 128 limite également la taille des représentations par rapport à des vecteurs de plus grande dimension.

Limites et points d'attention. Sur ViDoRe V1 et V2, consacré à la recherche visuelle dans divers types et domaines documentaires, le modèle se situe dans la partie basse du classement MTEB considéré. Ce résultat invite à valider sa précision sur les mises en page et corpus réellement visés avant déploiement. Son périmètre linguistique annoncé se concentre sur six langues. Sa représentation multi-vecteur visuelle impose par ailleurs une architecture d’indexation adaptée aux images de documents et aux comparaisons avec des requêtes textuelles. Usages pertinents : recherche sémantique sans OCR, RAG sur documents visuels, détection de pages similaires et regroupement de documents par proximité.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).