LCO-Embedding/LCO-Embedding-Omni-3B

Publié par LCO-Embedding le 23 octobre 2025 sous licence ouverte MIT, LCO-Embedding/LCO-Embedding-Omni-3B est un modèle d’embedding omnimodal de 5 milliards de paramètres actifs. Il produit une représentation dense unique de 2 048 dimensions à partir de contenus textuels et multimédias.

Publié par LCO-Embedding le 23 octobre 2025 sous licence ouverte MIT, LCO-Embedding/LCO-Embedding-Omni-3B est un modèle d’embedding omnimodal de 5 milliards de paramètres actifs. Il produit une représentation dense unique de 2 048 dimensions à partir de contenus textuels et multimédias.

Centré sur le langage, il reprend le composant « thinker » de Qwen2.5 Omni sans le composant « talker ». Il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, notamment entre texte, image, audio et vidéo. Son interface Sentence Transformers accepte du texte, des fichiers, des URL et des dictionnaires multimodaux.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurLCO-Embedding
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie23 octobre 2025
Dimension du vecteur2 048
Représentationvecteur dense unique
Paramètres5 milliards
Paramètres actifs5 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)audio,image,text,video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image-Text, Lite66,4 %2ᵉ / 49mteb✅ Mesuré
MTEB: MVEB Video-Only61,6 %4ᵉ / 32mteb✅ Mesuré
MTEB: MVEB Video-Text54,8 %4ᵉ / 23mteb✅ Mesuré
MTEB: MVEB54,6 %5ᵉ / 15mteb✅ Mesuré
MTEB: MAEB52,3 %4ᵉ / 21mteb✅ Mesuré
MTEB: MAEB Audio-Only49,8 %6ᵉ / 60mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Image-Text, Lite

▶ LCO-Embedding/LCO-Embed…66 %

MTEB: MVEB Video-Only

▶ LCO-Embedding/LCO-Embed…62 %

Notre analyse

Forces. LCO-Embedding/LCO-Embedding-Omni-3B se distingue surtout sur les tâches multimodales. Ses meilleurs résultats MTEB concernent l’association multilingue entre image et texte, où il se place parmi les modèles de tête. Il figure également dans le top 10 des évaluations consacrées à la vidéo seule, aux correspondances entre texte et vidéo, aux représentations audiovisuelles et aux tâches audio. Cette couverture convient à la recherche, à la classification, au clustering et à la comparaison de contenus entre plusieurs modalités. La licence MIT autorise l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d'attention. Les résultats sont moins élevés sur MAEB Audio-Only et sur les évaluations combinant audio, vidéo et texte que sur Image-Text, Lite. La représentation dense de 2 048 dimensions implique aussi des index plus volumineux et davantage de calcul lors de la recherche qu’avec des vecteurs plus courts. Avec 5 milliards de paramètres actifs, le déploiement demande par ailleurs une infrastructure adaptée à l’encodage. Usages pertinents : recherche sémantique multimodale, RAG associant texte et médias, déduplication, similarité et clustering d’images, d’audios ou de vidéos.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).