cl-nagoya/ruri-base-v2

Publié par cl-nagoya le 5 décembre 2024 sous licence ouverte Apache 2.0, cl-nagoya/ruri-base-v2 est un modèle d’embedding japonais de 111 millions de paramètres. Fondé sur cl-nagoya/ruri-pt-base-v2, il utilise une architecture BERT et produit un vecteur dense de 768 dimensions par texte.

Publié par cl-nagoya le 5 décembre 2024 sous licence ouverte Apache 2.0, cl-nagoya/ruri-base-v2 est un modèle d’embedding japonais de 111 millions de paramètres. Fondé sur cl-nagoya/ruri-pt-base-v2, il utilise une architecture BERT et produit un vecteur dense de 768 dimensions par texte.

Le modèle traite jusqu’à 512 tokens et agrège les tokens par pooling moyen. Les vecteurs sont comparés par similarité cosinus pour la recherche sémantique, l’indexation de passages dans un système RAG, la mesure de similarité ou le clustering. Les requêtes et passages doivent être préfixés respectivement par « クエリ: » et « 文章: ».

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcl-nagoya
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie5 décembre 2024
Dimension du vecteur768
Représentationdense (un vecteur par texte)
Paramètres111 millions
Paramètres actifs111 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Japanese68,3 %16ᵉ / 20mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Sa spécialisation dans les embeddings japonais répond directement aux besoins de recherche, de classification, de similarité sémantique et de clustering sur cette langue. Son score global sur MTEB: Japanese confirme une qualité exploitable sur cet ensemble de tâches, même sans le placer parmi les premiers modèles évalués. Ses 111 millions de paramètres facilitent un déploiement plus léger que celui de modèles d’embedding beaucoup plus volumineux. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des services commerciaux. Le format dense à 768 dimensions s’insère dans les moteurs vectoriels courants.

Limites et points d'attention. Son rang de 16e sur 21 dans MTEB: Japanese le situe dans le bas du classement de cette évaluation, ce qui indique un avantage compétitif limité face aux autres modèles testés. La fenêtre de 512 tokens impose de découper les documents longs avant indexation. Les préfixes japonais requis pour les requêtes et les passages doivent être appliqués correctement, faute de quoi la représentation peut ne pas correspondre au format prévu pour la recherche. Avec environ deux ans d’ancienneté, il appartient à une génération probablement dépassée par des offres plus récentes et souvent retirée des catalogues. Usages pertinents : recherche sémantique japonaise, RAG, similarité et clustering avec auto-hébergement.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).