BidirLM/BidirLM-0.6B-Embedding
BidirLM/BidirLM-0.6B-Embedding est un modèle d’embedding dense de 596 millions de paramètres publié par BidirLM le 7 avril 2026. Adapté du modèle causal Qwen3-0.6B en encodeur bidirectionnel, il produit des vecteurs de 1 024 dimensions par mean pooling.
BidirLM/BidirLM-0.6B-Embedding est un modèle d’embedding dense de 596 millions de paramètres publié par BidirLM le 7 avril 2026. Adapté du modèle causal Qwen3-0.6B en encodeur bidirectionnel, il produit des vecteurs de 1 024 dimensions par mean pooling.
Son support multilingue couvre plus de 119 langues, avec un entraînement contrastif portant sur 87 langues. Distribué sous licence ouverte Apache 2.0, il sert notamment à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité, au clustering, à la classification, au reranking et au bitext mining.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BidirLM |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 7 avril 2026 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 596 millions |
| Paramètres actifs | 596 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 71,9 % | 13ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Dutch | 56,2 % | 24ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 1,2 % | 31ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Dutch
Notre analyse
Forces. Le modèle se distingue surtout sur MTEB Long-context Retrieval, où il figure dans le premier groupe du classement. Ce résultat le rend particulièrement adapté à la recherche dans des contenus longs, qu’ils soient synthétiques ou issus de cas réels. Son positionnement sur MTEB Dutch indique également une capacité solide à représenter des textes néerlandais, cohérente avec sa large couverture multilingue. Son architecture combine un préentraînement par masquage MNTP et un ajustement contrastif. L’intégration à Sentence Transformers facilite son emploi pour la recherche, la similarité, le clustering et le reranking, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’adaptation.
Limites et points d’attention. Le résultat très faible sur MTEB Instruction Following montre que les requêtes formulées comme des consignes constituent son principal point faible mesuré. Une représentation de 1 024 dimensions augmente aussi la taille des index et le coût des calculs de similarité par rapport à des embeddings moins dimensionnels. Le modèle reste un encodeur de texte et ne produit pas de réponses génératives. Usages pertinents : recherche sémantique multilingue, récupération de documents longs pour le RAG, détection de similarité, clustering, classification, reranking et alignement de textes bilingues.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).