BidirLM/BidirLM-270M-Embedding

Publié par BidirLM le 7 avril 2026 sous licence ouverte Apache 2.0, BidirLM/BidirLM-270M-Embedding est un encodeur bidirectionnel de 268 millions de paramètres, adapté de Gemma3-270M. Il transforme chaque texte en un vecteur dense unique de 640 dimensions, obtenu par mean pooling.

Publié par BidirLM le 7 avril 2026 sous licence ouverte Apache 2.0, BidirLM/BidirLM-270M-Embedding est un encodeur bidirectionnel de 268 millions de paramètres, adapté de Gemma3-270M. Il transforme chaque texte en un vecteur dense unique de 640 dimensions, obtenu par mean pooling.

Son support multilingue couvre plus de 140 langues, avec un entraînement contrastif portant sur 87 langues. Compatible avec Sentence Transformers, il sert à la recherche sémantique, au RAG, à la similarité, au clustering, à la classification, au reranking et au bitext mining. Il produit des représentations numériques et ne génère pas de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBidirLM
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie7 avril 2026
Dimension du vecteur640
Représentationdense (vecteur unique obtenu par mean pooling)
Paramètres268 millions
Paramètres actifs268 millions
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval71,8 %14ᵉ / 170mteb✅ Mesuré
MTEB: Dutch50,9 %40ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur résultat relatif de BidirLM/BidirLM-270M-Embedding apparaît sur MTEB Long-context Retrieval, où il se classe parmi les modèles les mieux placés. Ce positionnement le rend particulièrement intéressant pour retrouver des passages pertinents dans des corpus comprenant des contenus longs, qu’il s’agisse de tâches synthétiques ou réelles. Son résultat sur le track Dutch se situe dans la partie supérieure du classement, en cohérence avec son orientation multilingue. Ses vecteurs denses de 640 dimensions offrent une représentation relativement compacte pour constituer des index sémantiques. La licence Apache 2.0 facilite par ailleurs l’auto-hébergement, l’intégration et l’adaptation du modèle.

Limites et points d'attention. Le track MTEB Instruction Following constitue son principal point faible, avec un classement nettement inférieur à ceux obtenus en recherche en contexte long et en néerlandais. Le modèle convient donc moins aux systèmes de retrieval dans lesquels des consignes détaillées doivent modifier précisément les critères de sélection des résultats. Son entraînement combine un masquage MNTP préalable et un ajustement contrastif, mais sa fonction reste l’encodage vectoriel, sans génération de réponse. Usages pertinents : recherche sémantique multilingue, RAG, détection de similarité, clustering, classification, reranking et alignement de textes bilingues.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).