cl-nagoya/ruri-v3-70m

Publié par cl-nagoya le 9 avril 2025, cl-nagoya/ruri-v3-70m est un modèle d’embedding japonais généraliste de 70 millions de paramètres, tous actifs. Fondé sur ModernBERT-Ja, il produit une représentation dense unique. La dimension de sortie répertoriée est de 256, tandis que…

Publié par cl-nagoya le 9 avril 2025, cl-nagoya/ruri-v3-70m est un modèle d’embedding japonais généraliste de 70 millions de paramètres, tous actifs. Fondé sur ModernBERT-Ja, il produit une représentation dense unique. La dimension de sortie répertoriée est de 256, tandis que l’architecture déclarée décrit des embeddings de 384 dimensions.

Le modèle traite jusqu’à 8 192 tokens et vise la recherche sémantique, l’indexation pour le RAG, la similarité, la classification et le clustering. Sa licence ouverte Apache 2.0 autorise l’auto-hébergement. Des préfixes adaptent l’encodage aux requêtes, aux documents et aux différentes tâches sémantiques.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcl-nagoya
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie9 avril 2025
Dimension du vecteur256
Représentationdense (vecteur unique)
Paramètres70 millions
Paramètres actifs70 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Japanese70,6 %11ᵉ / 20mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Sur MTEB Japanese, cl-nagoya/ruri-v3-70m affiche une qualité globale solide pour des tâches japonaises de clustering, de classification et de similarité sémantique, même s’il ne domine pas le classement. Sa fenêtre de 8 192 tokens facilite l’encodage de documents relativement longs pour la recherche et le RAG. Le pooling moyen des tokens, la comparaison par similarité cosinus et les préfixes spécialisés structurent son usage selon la tâche. Le tokenizer SentencePiece, doté d’un vocabulaire de 100 000 tokens, fonctionne sans segmentation externe. FlashAttention complète cette architecture. Une sortie de 256 dimensions permet en principe des index plus compacts, et la licence Apache 2.0 facilite le déploiement autonome.

Limites et points d'attention. Son rang en milieu de tableau sur MTEB Japanese indique qu’il est dépassé par plusieurs concurrents de sa période. Sorti il y a environ un an, il est déjà ancien à l’échelle de l’IA et peut avoir été supplanté, voire retiré du catalogue courant de son éditeur. L’écart entre la dimension répertoriée de 256 et les 384 dimensions déclarées doit être vérifié lors de l’intégration, car il affecte le schéma d’indexation et le stockage. Les usages pertinents sont la recherche sémantique japonaise, le RAG sur documents longs, la similarité, la classification et le clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).