cl-nagoya/ruri-v3-310m

Publié par cl-nagoya le 9 avril 2025 sous licence ouverte Apache 2.0, cl-nagoya/ruri-v3-310m est un modèle généraliste d’embeddings japonais de 315 millions de paramètres. Construit sur ModernBERT-Ja, il produit des représentations denses de 768 dimensions avec pooling moyen et…

Publié par cl-nagoya le 9 avril 2025 sous licence ouverte Apache 2.0, cl-nagoya/ruri-v3-310m est un modèle généraliste d’embeddings japonais de 315 millions de paramètres. Construit sur ModernBERT-Ja, il produit des représentations denses de 768 dimensions avec pooling moyen et comparaison par similarité cosinus.

Fourni au format Sentence Transformer, il encode jusqu’à 8 192 tokens et emploie un vocabulaire de 100 000 tokens fondé uniquement sur SentencePiece. Il sert notamment à la recherche sémantique, au RAG, à la mesure de similarité, à la classification et au clustering de textes japonais.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcl-nagoya
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie9 avril 2025
Dimension du vecteur768
Représentationdense
Paramètres315 millions
Paramètres actifs315 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Japanese72,4 %8ᵉ / 20mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Japanese

▶ cl-nagoya/ruri-v3-310m72 %

Notre analyse

Forces. Son résultat au MTEB Japanese le place dans le top 10 de cette évaluation, qui couvre notamment le clustering, la classification et la similarité sémantique. Sa fenêtre de 8 192 tokens favorise l’encodage de documents relativement longs, tandis que FlashAttention facilite le traitement de ces séquences. La dimension de 768 offre un compromis pratique entre richesse de représentation et poids des index. Des préfixes distincts adaptent l’encodage aux requêtes, aux documents de recherche, à la classification, au clustering et aux sujets. La licence Apache 2.0 autorise par ailleurs l’auto-hébergement et l’intégration dans des services commerciaux.

Limites et points d’attention. Le modèle est spécialisé dans le japonais plutôt que présenté comme multilingue. Ses 315 millions de paramètres impliquent davantage de calcul qu’un encodeur plus petit, et les préfixes attendus doivent être appliqués conformément au type de tâche afin de conserver un encodage adapté. Sorti il y a environ un an, il est déjà ancien à l’échelle rapide de l’IA et peut être dépassé par des modèles japonais plus récents. Usages pertinents : recherche sémantique japonaise, RAG sur documents longs, détection de similarité, classification et clustering thématique.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).