NbAiLab/nb-sbert-base
Publié par NbAiLab le 23 novembre 2022, NbAiLab/nb-sbert-base est un modèle d’embedding dense de 178 millions de paramètres, tous actifs. Fondé sur nb-bert-base et entraîné sur une traduction automatique en norvégien de MNLI, il cible particulièrement le norvégien et l’alignement…
Publié par NbAiLab le 23 novembre 2022, NbAiLab/nb-sbert-base est un modèle d’embedding dense de 178 millions de paramètres, tous actifs. Fondé sur nb-bert-base et entraîné sur une traduction automatique en norvégien de MNLI, il cible particulièrement le norvégien et l’alignement sémantique entre langues, notamment entre l’anglais et le norvégien.
Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré à des systèmes de recherche sémantique, de RAG, de similarité ou de clustering. Sa dimension de sortie est référencée à 4 096, tandis que son architecture SentenceTransformers produit des représentations par mean pooling.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | NbAiLab |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 23 novembre 2022 |
| Dimension du vecteur | 4 096 |
| Représentation | dense |
| Paramètres | 178 millions |
| Paramètres actifs | 178 millions |
| Longueur de séquence max | 75 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Scandinavian | 51,9 % | 34ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Scandinavian
Notre analyse
Forces. Sa spécialisation scandinave et son entraînement sur des paires sémantiquement proches favorisent la comparaison de phrases et de paragraphes, y compris dans des scénarios anglais-norvégien. Le modèle convient à la recherche par similarité, au regroupement thématique et à la sélection de passages pour un pipeline RAG. Son format SentenceTransformers facilite aussi son emploi avec SetFit, KeyBERT et BERTopic. La licence Apache 2.0 autorise l’auto-hébergement et une intégration dans des applications commerciales.
Limites et points d’attention. Avec 52 % et un rang de 34 sur 48 dans MTEB Scandinavian, il se situe dans la partie basse du classement évalué plutôt que parmi les références de ce benchmark. Sa sortie référencée à 4 096 dimensions implique des index plus volumineux et une recherche vectorielle plus coûteuse que des représentations compactes. Une autre caractérisation technique indique toutefois des vecteurs de 768 dimensions, ce qui impose de vérifier la sortie effective lors du déploiement. Datant de 2022, il est très ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents, les modèles de sa période étant souvent retirés des catalogues. Usages pertinents : recherche et clustering en norvégien, rapprochement anglais-norvégien et expérimentations auto-hébergées.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).