cl-nagoya/ruri-base

cl-nagoya/ruri-base est un modèle d’embedding japonais publié par cl-nagoya le 28 août 2024 sous licence ouverte Apache 2.0. Fondé sur BERT et cl-nagoya/ruri-pt-base, ce Sentence Transformer compte 111 millions de paramètres actifs et produit des représentations denses de 768 dimensions…

cl-nagoya/ruri-base est un modèle d’embedding japonais publié par cl-nagoya le 28 août 2024 sous licence ouverte Apache 2.0. Fondé sur BERT et cl-nagoya/ruri-pt-base, ce Sentence Transformer compte 111 millions de paramètres actifs et produit des représentations denses de 768 dimensions par pooling moyen.

Le modèle traite des séquences allant jusqu’à 512 tokens et compare les vecteurs par similarité cosinus. Il sert notamment à la recherche sémantique, à la récupération de passages pour le RAG, au classement par similarité et au clustering de textes japonais. Les préfixes « クエリ: » et « 文章: » distinguent respectivement les requêtes des passages.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcl-nagoya
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie28 août 2024
Dimension du vecteur768
Représentationdense
Paramètres111 millions
Paramètres actifs111 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Japanese66,0 %18ᵉ / 20mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. cl-nagoya/ruri-base couvre plusieurs usages évalués par MTEB: Japanese, notamment le clustering, la classification et la similarité sémantique. Son format Sentence Transformer facilite la création d’index vectoriels et la comparaison de textes japonais. La distinction explicite entre requêtes et passages convient aux systèmes de recherche et de RAG. La limite de 512 tokens permet d’encoder des passages relativement développés, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des produits commerciaux.

Limites et points d’attention. Son résultat global sur MTEB: Japanese le place dans le bas du classement, au 18e rang sur 21, ce qui indique une qualité moins compétitive que celle de la majorité des modèles comparés sur cet ensemble de tâches. Sorti en août 2024, il appartient à une génération désormais ancienne à l’échelle de l’IA et peut être dépassé par des modèles japonais plus récents. Les vecteurs de 768 dimensions imposent aussi un stockage et un calcul de recherche supérieurs à ceux de représentations moins dimensionnelles. Usages pertinents: recherche sémantique, RAG, similarité et clustering sur des corpus japonais, notamment dans un environnement auto-hébergé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).