cl-nagoya/ruri-base
cl-nagoya/ruri-base est un modèle d’embedding japonais publié par cl-nagoya le 28 août 2024 sous licence ouverte Apache 2.0. Fondé sur BERT et cl-nagoya/ruri-pt-base, ce Sentence Transformer compte 111 millions de paramètres actifs et produit des représentations denses de 768 dimensions…
cl-nagoya/ruri-base est un modèle d’embedding japonais publié par cl-nagoya le 28 août 2024 sous licence ouverte Apache 2.0. Fondé sur BERT et cl-nagoya/ruri-pt-base, ce Sentence Transformer compte 111 millions de paramètres actifs et produit des représentations denses de 768 dimensions par pooling moyen.
Le modèle traite des séquences allant jusqu’à 512 tokens et compare les vecteurs par similarité cosinus. Il sert notamment à la recherche sémantique, à la récupération de passages pour le RAG, au classement par similarité et au clustering de textes japonais. Les préfixes « クエリ: » et « 文章: » distinguent respectivement les requêtes des passages.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | cl-nagoya |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 28 août 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 111 millions |
| Paramètres actifs | 111 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Japanese | 66,0 % | 18ᵉ / 20 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Japanese
Notre analyse
Forces. cl-nagoya/ruri-base couvre plusieurs usages évalués par MTEB: Japanese, notamment le clustering, la classification et la similarité sémantique. Son format Sentence Transformer facilite la création d’index vectoriels et la comparaison de textes japonais. La distinction explicite entre requêtes et passages convient aux systèmes de recherche et de RAG. La limite de 512 tokens permet d’encoder des passages relativement développés, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des produits commerciaux.
Limites et points d’attention. Son résultat global sur MTEB: Japanese le place dans le bas du classement, au 18e rang sur 21, ce qui indique une qualité moins compétitive que celle de la majorité des modèles comparés sur cet ensemble de tâches. Sorti en août 2024, il appartient à une génération désormais ancienne à l’échelle de l’IA et peut être dépassé par des modèles japonais plus récents. Les vecteurs de 768 dimensions imposent aussi un stockage et un calcul de recherche supérieurs à ceux de représentations moins dimensionnelles. Usages pertinents: recherche sémantique, RAG, similarité et clustering sur des corpus japonais, notamment dans un environnement auto-hébergé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).