LCO-Embedding/LCO-Embedding-Omni-3B
Publié par LCO-Embedding le 23 octobre 2025 sous licence ouverte MIT, LCO-Embedding/LCO-Embedding-Omni-3B est un modèle d’embedding omnimodal de 5 milliards de paramètres actifs. Il produit une représentation dense unique de 2 048 dimensions à partir de contenus textuels et multimédias.
Publié par LCO-Embedding le 23 octobre 2025 sous licence ouverte MIT, LCO-Embedding/LCO-Embedding-Omni-3B est un modèle d’embedding omnimodal de 5 milliards de paramètres actifs. Il produit une représentation dense unique de 2 048 dimensions à partir de contenus textuels et multimédias.
Centré sur le langage, il reprend le composant « thinker » de Qwen2.5 Omni sans le composant « talker ». Il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, notamment entre texte, image, audio et vidéo. Son interface Sentence Transformers accepte du texte, des fichiers, des URL et des dictionnaires multimodaux.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | LCO-Embedding |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 23 octobre 2025 |
| Dimension du vecteur | 2 048 |
| Représentation | vecteur dense unique |
| Paramètres | 5 milliards |
| Paramètres actifs | 5 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | audio,image,text,video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image-Text, Lite | 66,4 % | 2ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Only | 61,6 % | 4ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Text | 54,8 % | 4ᵉ / 23 | mteb | ✅ Mesuré |
| MTEB: MVEB | 54,6 % | 5ᵉ / 15 | mteb | ✅ Mesuré |
| MTEB: MAEB | 52,3 % | 4ᵉ / 21 | mteb | ✅ Mesuré |
| MTEB: MAEB Audio-Only | 49,8 % | 6ᵉ / 60 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image-Text, Lite
MTEB: MVEB Video-Only
Notre analyse
Forces. LCO-Embedding/LCO-Embedding-Omni-3B se distingue surtout sur les tâches multimodales. Ses meilleurs résultats MTEB concernent l’association multilingue entre image et texte, où il se place parmi les modèles de tête. Il figure également dans le top 10 des évaluations consacrées à la vidéo seule, aux correspondances entre texte et vidéo, aux représentations audiovisuelles et aux tâches audio. Cette couverture convient à la recherche, à la classification, au clustering et à la comparaison de contenus entre plusieurs modalités. La licence MIT autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d'attention. Les résultats sont moins élevés sur MAEB Audio-Only et sur les évaluations combinant audio, vidéo et texte que sur Image-Text, Lite. La représentation dense de 2 048 dimensions implique aussi des index plus volumineux et davantage de calcul lors de la recherche qu’avec des vecteurs plus courts. Avec 5 milliards de paramètres actifs, le déploiement demande par ailleurs une infrastructure adaptée à l’encodage. Usages pertinents : recherche sémantique multimodale, RAG associant texte et médias, déduplication, similarité et clustering d’images, d’audios ou de vidéos.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).