cl-nagoya/ruri-base-v2
Publié par cl-nagoya le 5 décembre 2024 sous licence ouverte Apache 2.0, cl-nagoya/ruri-base-v2 est un modèle d’embedding japonais de 111 millions de paramètres. Fondé sur cl-nagoya/ruri-pt-base-v2, il utilise une architecture BERT et produit un vecteur dense de 768 dimensions par texte.
Publié par cl-nagoya le 5 décembre 2024 sous licence ouverte Apache 2.0, cl-nagoya/ruri-base-v2 est un modèle d’embedding japonais de 111 millions de paramètres. Fondé sur cl-nagoya/ruri-pt-base-v2, il utilise une architecture BERT et produit un vecteur dense de 768 dimensions par texte.
Le modèle traite jusqu’à 512 tokens et agrège les tokens par pooling moyen. Les vecteurs sont comparés par similarité cosinus pour la recherche sémantique, l’indexation de passages dans un système RAG, la mesure de similarité ou le clustering. Les requêtes et passages doivent être préfixés respectivement par « クエリ: » et « 文章: ».
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | cl-nagoya |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 5 décembre 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense (un vecteur par texte) |
| Paramètres | 111 millions |
| Paramètres actifs | 111 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Japanese | 68,3 % | 16ᵉ / 20 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Japanese
Notre analyse
Forces. Sa spécialisation dans les embeddings japonais répond directement aux besoins de recherche, de classification, de similarité sémantique et de clustering sur cette langue. Son score global sur MTEB: Japanese confirme une qualité exploitable sur cet ensemble de tâches, même sans le placer parmi les premiers modèles évalués. Ses 111 millions de paramètres facilitent un déploiement plus léger que celui de modèles d’embedding beaucoup plus volumineux. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des services commerciaux. Le format dense à 768 dimensions s’insère dans les moteurs vectoriels courants.
Limites et points d'attention. Son rang de 16e sur 21 dans MTEB: Japanese le situe dans le bas du classement de cette évaluation, ce qui indique un avantage compétitif limité face aux autres modèles testés. La fenêtre de 512 tokens impose de découper les documents longs avant indexation. Les préfixes japonais requis pour les requêtes et les passages doivent être appliqués correctement, faute de quoi la représentation peut ne pas correspondre au format prévu pour la recherche. Avec environ deux ans d’ancienneté, il appartient à une génération probablement dépassée par des offres plus récentes et souvent retirée des catalogues. Usages pertinents : recherche sémantique japonaise, RAG, similarité et clustering avec auto-hébergement.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).