cl-nagoya/ruri-large-v2

Publié par cl-nagoya le 6 décembre 2024, cl-nagoya/ruri-large-v2 est un modèle d’embedding japonais de 337 millions de paramètres, sous licence ouverte Apache 2.0. Fondé sur une architecture BERT, il transforme des séquences de 512 tokens au maximum en vecteurs denses de 1024 dimensions…

Publié par cl-nagoya le 6 décembre 2024, cl-nagoya/ruri-large-v2 est un modèle d’embedding japonais de 337 millions de paramètres, sous licence ouverte Apache 2.0. Fondé sur une architecture BERT, il transforme des séquences de 512 tokens au maximum en vecteurs denses de 1024 dimensions grâce à un pooling moyen des tokens.

Conçu à partir de cl-nagoya/ruri-pt-large-v2, il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering de textes japonais. La comparaison repose sur la similarité cosinus, avec les préfixes « クエリ: » pour les requêtes et « 文章: » pour les passages.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcl-nagoya
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie6 décembre 2024
Dimension du vecteur1 024
Représentationdense
Paramètres337 millions
Paramètres actifs337 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Japanese69,5 %13ᵉ / 20mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Son évaluation MTEB: Japanese couvre plusieurs usages complémentaires, notamment le clustering, la classification et la similarité sémantique. Le résultat global le place toutefois plutôt dans la seconde moitié des modèles évalués que parmi les meilleurs. Ses 337 millions de paramètres actifs offrent une architecture relativement contenue, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. La distinction explicite entre requêtes et passages est adaptée aux moteurs de recherche sémantique et aux systèmes RAG en japonais. Les caractéristiques principales sont corroborées par deux sources concordantes.

Limites et points d’attention. Les vecteurs denses de 1024 dimensions alourdissent l’index et augmentent le coût de stockage et de recherche par rapport à des représentations plus compactes. La limite de 512 tokens impose de découper les documents longs avant leur indexation. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, le modèle doit être comparé aux références de sa période et peut désormais être dépassé, voire retiré des catalogues courants. Usages pertinents : recherche sémantique, RAG, similarité et regroupement de contenus japonais de longueur modérée.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).