cl-nagoya/ruri-v3-30m

Publié par cl-nagoya le 7 avril 2025, cl-nagoya/ruri-v3-30m est un modèle d’embedding japonais généraliste fondé sur ModernBERT-Ja. Ses 37 millions de paramètres, tous actifs, produisent un vecteur dense de 256 dimensions par pooling moyen. Il traite des séquences allant jusqu’à 8 192…

Publié par cl-nagoya le 7 avril 2025, cl-nagoya/ruri-v3-30m est un modèle d’embedding japonais généraliste fondé sur ModernBERT-Ja. Ses 37 millions de paramètres, tous actifs, produisent un vecteur dense de 256 dimensions par pooling moyen. Il traite des séquences allant jusqu’à 8 192 tokens.

Ce Sentence Transformer sert à la recherche sémantique, au RAG, à la mesure de similarité par cosinus, à la classification et au clustering. Il distingue les requêtes, les documents et plusieurs catégories de tâches grâce à des préfixes dédiés. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcl-nagoya
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie7 avril 2025
Dimension du vecteur256
Représentationdense (vecteur unique obtenu par pooling moyen)
Paramètres37 millions
Paramètres actifs37 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Japanese69,4 %14ᵉ / 20mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le modèle associe un format relativement compact à une fenêtre de 8 192 tokens, utile pour vectoriser des documents longs sans produire un index excessivement volumineux. Ses vecteurs de 256 dimensions allègent le stockage et les calculs de similarité par rapport à des représentations plus larges. Le vocabulaire de 100 000 tokens repose exclusivement sur SentencePiece, sans segmentation externe. Les préfixes propres à la recherche, au sens sémantique, à la classification et au clustering permettent d’adapter les représentations à plusieurs usages. FlashAttention soutient le traitement des longues séquences, tandis que la licence Apache 2.0 facilite le déploiement autonome.

Limites et points d'attention. Sur MTEB: Japanese, son résultat global de 69 % et son rang de 14e sur 21 le placent dans la partie basse du classement évalué, sans en faire une référence dominante pour la qualité générale des embeddings japonais. Sorti il y a environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et peut être dépassé par des modèles japonais plus récents, voire retiré des catalogues courants. Sa spécialisation japonaise ne constitue pas un choix adapté à un corpus principalement multilingue. Usages pertinents : recherche sémantique et RAG en japonais, clustering, classification et indexation compacte de documents longs.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).