cl-nagoya/ruri-v3-130m

Publié par cl-nagoya le 9 avril 2025 sous licence ouverte Apache 2.0, cl-nagoya/ruri-v3-130m est un modèle d’embedding japonais à usage général fondé sur ModernBERT-Ja. Ses 132 millions de paramètres produisent un vecteur dense unique de 512 dimensions.

Publié par cl-nagoya le 9 avril 2025 sous licence ouverte Apache 2.0, cl-nagoya/ruri-v3-130m est un modèle d’embedding japonais à usage général fondé sur ModernBERT-Ja. Ses 132 millions de paramètres produisent un vecteur dense unique de 512 dimensions.

Le modèle encode jusqu’à 8 192 tokens avec un tokenizer SentencePiece, un pooling moyen des tokens et FlashAttention. Des préfixes adaptent l’encodage à la recherche sémantique, au RAG, à la classification ou au clustering thématique, tandis que la proximité entre vecteurs se mesure par similarité cosinus.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcl-nagoya
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie9 avril 2025
Dimension du vecteur512
Représentationdense (vecteur unique)
Paramètres132 millions
Paramètres actifs132 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Japanese71,9 %9ᵉ / 20mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Son résultat au benchmark MTEB: Japanese le classe dans le top 10, ce qui indique une qualité globale solide sur les tâches japonaises évaluées, notamment le clustering, la classification et la similarité sémantique. La fenêtre de 8 192 tokens facilite l’encodage de documents longs, un atout pour indexer des contenus japonais dans des systèmes de recherche ou de RAG. Les vecteurs de 512 dimensions offrent un compromis compact pour limiter la taille des index et le coût de la recherche. La licence Apache 2.0 autorise par ailleurs l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d’attention. Son classement reste inférieur à celui des meilleurs modèles du benchmark MTEB: Japanese. Son orientation japonaise le destine d’abord aux corpus et requêtes dans cette langue. Sorti il y a environ un an, il est déjà ancien à l’échelle rapide de l’IA et probablement dépassé par des modèles plus récents de sa catégorie, avec un risque de retrait des catalogues. Les préfixes doivent être choisis selon la tâche afin de conserver le comportement d’encodage attendu. Usages pertinents : recherche sémantique japonaise, RAG sur documents longs, détection de similarité, classification et clustering thématique.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).