BidirLM/BidirLM-1B-Embedding
Publié le 7 avril 2026 par BidirLM sous licence ouverte Apache 2.0, BidirLM/BidirLM-1B-Embedding est un modèle dense d’un milliard de paramètres. Il transforme les textes en vecteurs de 1 152 dimensions et repose sur un encodeur bidirectionnel adapté de Gemma3-1B, avec mean pooling.
Publié le 7 avril 2026 par BidirLM sous licence ouverte Apache 2.0, BidirLM/BidirLM-1B-Embedding est un modèle dense d’un milliard de paramètres. Il transforme les textes en vecteurs de 1 152 dimensions et repose sur un encodeur bidirectionnel adapté de Gemma3-1B, avec mean pooling.
Son support multilingue couvre plus de 140 langues, avec un entraînement contrastif mené sur 87 langues. Son architecture conserve le contexte complet du modèle de base. Il cible notamment la recherche sémantique, le RAG, la similarité, le clustering, la classification, le reranking et le bitext mining.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | BidirLM |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 7 avril 2026 |
| Dimension du vecteur | 1 152 |
| Représentation | dense |
| Paramètres | 1 milliards |
| Paramètres actifs | 1 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 76,4 % | 6ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Dutch | 59,2 % | 16ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Dutch
Notre analyse
Forces. BidirLM/BidirLM-1B-Embedding se distingue surtout en Long-context Retrieval sur MTEB, où il figure dans le top 10. Ce positionnement le rend adapté à l’indexation et à la recherche dans des documents longs, son architecture exploitant le contexte complet du modèle de base. Son résultat solide sur le track Dutch complète une couverture multilingue étendue à plus de 140 langues. La préparation par masquage MNTP, suivie d’un ajustement contrastif, vise des représentations utiles à la recherche, à la similarité et au regroupement de contenus. La licence Apache 2.0 facilite par ailleurs l’auto-hébergement, l’intégration et l’adaptation du modèle.
Limites et points d'attention. Le track MTEB Instruction Following constitue son principal point faible parmi les évaluations disponibles. Le modèle paraît donc moins adapté lorsque la recherche doit respecter finement des consignes formulées dans la requête. Ses vecteurs de 1 152 dimensions impliquent aussi des index plus volumineux et des calculs de similarité plus coûteux que des représentations de dimension inférieure. Usages pertinents : RAG sur documents longs, recherche sémantique multilingue, similarité, clustering, classification, reranking et bitext mining.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).