cl-nagoya/ruri-v3-30m
Publié par cl-nagoya le 7 avril 2025, cl-nagoya/ruri-v3-30m est un modèle d’embedding japonais généraliste fondé sur ModernBERT-Ja. Ses 37 millions de paramètres, tous actifs, produisent un vecteur dense de 256 dimensions par pooling moyen. Il traite des séquences allant jusqu’à 8 192…
Publié par cl-nagoya le 7 avril 2025, cl-nagoya/ruri-v3-30m est un modèle d’embedding japonais généraliste fondé sur ModernBERT-Ja. Ses 37 millions de paramètres, tous actifs, produisent un vecteur dense de 256 dimensions par pooling moyen. Il traite des séquences allant jusqu’à 8 192 tokens.
Ce Sentence Transformer sert à la recherche sémantique, au RAG, à la mesure de similarité par cosinus, à la classification et au clustering. Il distingue les requêtes, les documents et plusieurs catégories de tâches grâce à des préfixes dédiés. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | cl-nagoya |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 7 avril 2025 |
| Dimension du vecteur | 256 |
| Représentation | dense (vecteur unique obtenu par pooling moyen) |
| Paramètres | 37 millions |
| Paramètres actifs | 37 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Japanese | 69,4 % | 14ᵉ / 20 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Japanese
Notre analyse
Forces. Le modèle associe un format relativement compact à une fenêtre de 8 192 tokens, utile pour vectoriser des documents longs sans produire un index excessivement volumineux. Ses vecteurs de 256 dimensions allègent le stockage et les calculs de similarité par rapport à des représentations plus larges. Le vocabulaire de 100 000 tokens repose exclusivement sur SentencePiece, sans segmentation externe. Les préfixes propres à la recherche, au sens sémantique, à la classification et au clustering permettent d’adapter les représentations à plusieurs usages. FlashAttention soutient le traitement des longues séquences, tandis que la licence Apache 2.0 facilite le déploiement autonome.
Limites et points d'attention. Sur MTEB: Japanese, son résultat global de 69 % et son rang de 14e sur 21 le placent dans la partie basse du classement évalué, sans en faire une référence dominante pour la qualité générale des embeddings japonais. Sorti il y a environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et peut être dépassé par des modèles japonais plus récents, voire retiré des catalogues courants. Sa spécialisation japonaise ne constitue pas un choix adapté à un corpus principalement multilingue. Usages pertinents : recherche sémantique et RAG en japonais, clustering, classification et indexation compacte de documents longs.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).