BidirLM/BidirLM-1.7B-Embedding
Publié par BidirLM le 7 avril 2026 sous licence ouverte Apache 2.0, BidirLM/BidirLM-1.7B-Embedding est un modèle dense de 2 milliards de paramètres actifs. Son encodeur bidirectionnel, adapté du décodeur causal Qwen3-1.7B, produit des vecteurs de 2 048 dimensions par mean pooling.
Publié par BidirLM le 7 avril 2026 sous licence ouverte Apache 2.0, BidirLM/BidirLM-1.7B-Embedding est un modèle dense de 2 milliards de paramètres actifs. Son encodeur bidirectionnel, adapté du décodeur causal Qwen3-1.7B, produit des vecteurs de 2 048 dimensions par mean pooling.
Le modèle couvre plus de 119 langues, dont 87 renforcées par un entraînement contrastif précédé d’une phase de masquage MNTP. Il transforme les textes en représentations numériques destinées notamment à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité, au clustering, à la classification, au reranking et au bitext mining.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BidirLM |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 7 avril 2026 |
| Dimension du vecteur | 2 048 |
| Représentation | dense |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 73,4 % | 10ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Dutch | 60,5 % | 13ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 0,5 % | 50ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Dutch
Notre analyse
Forces. BidirLM/BidirLM-1.7B-Embedding se distingue surtout sur MTEB Long-context Retrieval, où il figure dans le top 10. Ce résultat indique une aptitude marquée à retrouver des passages pertinents dans des tâches de recherche sur des contenus longs, synthétiques comme réels. Son résultat sur le track Dutch le place également parmi les modèles bien classés pour les textes néerlandais, en cohérence avec sa couverture multilingue étendue. La licence Apache 2.0 facilite l’auto-hébergement, la modification et l’intégration commerciale. Le modèle peut en outre être ajusté directement pour la classification de séquences ou de tokens, la recherche d’information et la régression de séquences.
Limites et points d'attention. Le track MTEB Instruction Following constitue son principal point faible parmi les évaluations disponibles. Le modèle paraît donc moins adapté aux scénarios de retrieval dans lesquels des consignes détaillées doivent modifier finement les critères de pertinence. Ses vecteurs denses de 2 048 dimensions impliquent aussi des index plus volumineux et davantage de calcul lors des recherches que des représentations de dimension inférieure. Usages pertinents : recherche sémantique multilingue, récupération de passages pour le RAG, exploration de documents longs, clustering, similarité et bitext mining.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).