cl-nagoya/ruri-large

Publié par cl-nagoya le 28 août 2024 sous licence ouverte Apache 2.0, cl-nagoya/ruri-large est un modèle d’embedding japonais de 337 millions de paramètres, tous actifs. Fondé sur BERT et cl-nagoya/ruri-pt-large, il accepte des séquences allant jusqu’à 512 tokens.

Publié par cl-nagoya le 28 août 2024 sous licence ouverte Apache 2.0, cl-nagoya/ruri-large est un modèle d’embedding japonais de 337 millions de paramètres, tous actifs. Fondé sur BERT et cl-nagoya/ruri-pt-large, il accepte des séquences allant jusqu’à 512 tokens.

Le modèle produit des vecteurs denses de 1024 dimensions par pooling moyen des tokens et mesure leur proximité par similarité cosinus. Il sert notamment à la recherche sémantique, au RAG, à la détection de similarités et au clustering de textes japonais. Les préfixes « クエリ: » et « 文章: » distinguent respectivement les requêtes des passages.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcl-nagoya
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie28 août 2024
Dimension du vecteur1 024
Représentationdense
Paramètres337 millions
Paramètres actifs337 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Japanese67,5 %17ᵉ / 20mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. cl-nagoya/ruri-large couvre plusieurs familles de tâches japonaises évaluées par MTEB, notamment le clustering, la classification et la similarité sémantique. Son architecture Sentence Transformer permet de comparer directement requêtes et documents dans un espace vectoriel dense. La fenêtre de 512 tokens convient aux passages de taille modérée, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. Les préfixes dédiés aux requêtes et aux passages structurent explicitement les usages de recherche.

Limites et points d'attention. Son résultat global sur MTEB: Japanese le place dans le bas du classement évalué, ce qui suggère des performances désormais moins compétitives. Avec environ deux ans d’ancienneté, il appartient à une génération déjà très ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et susceptible de ne plus figurer dans les catalogues courants. Les vecteurs de 1024 dimensions alourdissent l’index, la mémoire et le calcul de recherche, tandis que la limite de 512 tokens impose de segmenter les documents longs. Usages pertinents : recherche sémantique, RAG, similarité et clustering sur des corpus japonais de longueur modérée.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).