BidirLM/BidirLM-0.6B-Embedding

BidirLM/BidirLM-0.6B-Embedding est un modèle d’embedding dense de 596 millions de paramètres publié par BidirLM le 7 avril 2026. Adapté du modèle causal Qwen3-0.6B en encodeur bidirectionnel, il produit des vecteurs de 1 024 dimensions par mean pooling.

BidirLM/BidirLM-0.6B-Embedding est un modèle d’embedding dense de 596 millions de paramètres publié par BidirLM le 7 avril 2026. Adapté du modèle causal Qwen3-0.6B en encodeur bidirectionnel, il produit des vecteurs de 1 024 dimensions par mean pooling.

Son support multilingue couvre plus de 119 langues, avec un entraînement contrastif portant sur 87 langues. Distribué sous licence ouverte Apache 2.0, il sert notamment à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité, au clustering, à la classification, au reranking et au bitext mining.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBidirLM
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie7 avril 2026
Dimension du vecteur1 024
Représentationdense
Paramètres596 millions
Paramètres actifs596 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval71,9 %13ᵉ / 170mteb✅ Mesuré
MTEB: Dutch56,2 %24ᵉ / 113mteb✅ Mesuré
MTEB: Instruction Following1,2 %31ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le modèle se distingue surtout sur MTEB Long-context Retrieval, où il figure dans le premier groupe du classement. Ce résultat le rend particulièrement adapté à la recherche dans des contenus longs, qu’ils soient synthétiques ou issus de cas réels. Son positionnement sur MTEB Dutch indique également une capacité solide à représenter des textes néerlandais, cohérente avec sa large couverture multilingue. Son architecture combine un préentraînement par masquage MNTP et un ajustement contrastif. L’intégration à Sentence Transformers facilite son emploi pour la recherche, la similarité, le clustering et le reranking, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’adaptation.

Limites et points d’attention. Le résultat très faible sur MTEB Instruction Following montre que les requêtes formulées comme des consignes constituent son principal point faible mesuré. Une représentation de 1 024 dimensions augmente aussi la taille des index et le coût des calculs de similarité par rapport à des embeddings moins dimensionnels. Le modèle reste un encodeur de texte et ne produit pas de réponses génératives. Usages pertinents : recherche sémantique multilingue, récupération de documents longs pour le RAG, détection de similarité, clustering, classification, reranking et alignement de textes bilingues.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).