BidirLM/BidirLM-Omni-2.5B-Embedding
Publié par BidirLM le 7 avril 2026 sous licence ouverte Apache 2.0, BidirLM/BidirLM-Omni-2.5B-Embedding est un modèle d’embedding de 2 milliards de paramètres actifs. Il produit, par mean pooling, un vecteur dense unique de 2048 dimensions dans un espace partagé entre texte, image et…
Publié par BidirLM le 7 avril 2026 sous licence ouverte Apache 2.0, BidirLM/BidirLM-Omni-2.5B-Embedding est un modèle d’embedding de 2 milliards de paramètres actifs. Il produit, par mean pooling, un vecteur dense unique de 2048 dimensions dans un espace partagé entre texte, image et audio.
Son support multilingue couvre plus de 119 langues, avec un entraînement contrastif portant sur 87 langues. Compatible avec Sentence Transformers, il sert à la recherche sémantique et intermodale, au RAG, à la mesure de similarité, au clustering et à la classification, notamment entre texte et image ou entre texte et audio.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BidirLM |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 7 avril 2026 |
| Dimension du vecteur | 2 048 |
| Représentation | vecteur dense unique en espace partagé de 2048 dimensions, avec mean pooling, pour texte, image et audio |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text,image,audio,video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 58,0 % | 6ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 56,0 % | 8ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: MAEB Audio-Only | 53,6 % | 1ᵉ / 60 | mteb | ✅ Mesuré |
| MTEB: MAEB | 52,4 % | 3ᵉ / 21 | mteb | ✅ Mesuré |
| MTEB: MVEB | 51,2 % | 10ᵉ / 15 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 1,0 % | 34ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
MTEB: Image-Text, Lite
Notre analyse
Forces. BidirLM/BidirLM-Omni-2.5B-Embedding se distingue surtout sur l’audio. Il occupe la première place de MAEB Audio-Only et figure parmi les meilleurs de MAEB, qui combine tâches audio et correspondances audio-texte. Ses résultats le placent également dans le top 10 sur MVEB Video-Only et Image-Text, Lite, ce qui confirme son intérêt pour la classification, le clustering, la similarité et la recherche dans des corpus multimodaux et multilingues. L’espace vectoriel commun facilite les rapprochements entre modalités sans maintenir des représentations séparées. La licence Apache 2.0 autorise en outre l’auto-hébergement et l’adaptation du modèle.
Limites et points d'attention. Le résultat très faible sur MTEB Instruction Following signale une aptitude limitée à retrouver des contenus selon des consignes de recherche complexes. Sur MVEB, qui évalue plus largement les représentations vidéo audiovisuelles, le modèle reste dans le top 10 mais se classe près du bas des quinze systèmes comparés. Les vecteurs denses de 2048 dimensions augmentent aussi le stockage des index et le coût des calculs de similarité. Usages pertinents : recherche texte-image ou texte-audio, indexation audio, similarité multimodale, clustering et RAG multilingue lorsque les requêtes reposent sur la proximité sémantique plutôt que sur des instructions élaborées.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).