BidirLM/BidirLM-1B-Embedding

Publié le 7 avril 2026 par BidirLM sous licence ouverte Apache 2.0, BidirLM/BidirLM-1B-Embedding est un modèle dense d’un milliard de paramètres. Il transforme les textes en vecteurs de 1 152 dimensions et repose sur un encodeur bidirectionnel adapté de Gemma3-1B, avec mean pooling.

Publié le 7 avril 2026 par BidirLM sous licence ouverte Apache 2.0, BidirLM/BidirLM-1B-Embedding est un modèle dense d’un milliard de paramètres. Il transforme les textes en vecteurs de 1 152 dimensions et repose sur un encodeur bidirectionnel adapté de Gemma3-1B, avec mean pooling.

Son support multilingue couvre plus de 140 langues, avec un entraînement contrastif mené sur 87 langues. Son architecture conserve le contexte complet du modèle de base. Il cible notamment la recherche sémantique, le RAG, la similarité, le clustering, la classification, le reranking et le bitext mining.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurBidirLM
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie7 avril 2026
Dimension du vecteur1 152
Représentationdense
Paramètres1 milliards
Paramètres actifs1 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval76,4 %6ᵉ / 170mteb✅ Mesuré
MTEB: Dutch59,2 %16ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. BidirLM/BidirLM-1B-Embedding se distingue surtout en Long-context Retrieval sur MTEB, où il figure dans le top 10. Ce positionnement le rend adapté à l’indexation et à la recherche dans des documents longs, son architecture exploitant le contexte complet du modèle de base. Son résultat solide sur le track Dutch complète une couverture multilingue étendue à plus de 140 langues. La préparation par masquage MNTP, suivie d’un ajustement contrastif, vise des représentations utiles à la recherche, à la similarité et au regroupement de contenus. La licence Apache 2.0 facilite par ailleurs l’auto-hébergement, l’intégration et l’adaptation du modèle.

Limites et points d'attention. Le track MTEB Instruction Following constitue son principal point faible parmi les évaluations disponibles. Le modèle paraît donc moins adapté lorsque la recherche doit respecter finement des consignes formulées dans la requête. Ses vecteurs de 1 152 dimensions impliquent aussi des index plus volumineux et des calculs de similarité plus coûteux que des représentations de dimension inférieure. Usages pertinents : RAG sur documents longs, recherche sémantique multilingue, similarité, clustering, classification, reranking et bitext mining.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).