cl-nagoya/ruri-large
Publié par cl-nagoya le 28 août 2024 sous licence ouverte Apache 2.0, cl-nagoya/ruri-large est un modèle d’embedding japonais de 337 millions de paramètres, tous actifs. Fondé sur BERT et cl-nagoya/ruri-pt-large, il accepte des séquences allant jusqu’à 512 tokens.
Publié par cl-nagoya le 28 août 2024 sous licence ouverte Apache 2.0, cl-nagoya/ruri-large est un modèle d’embedding japonais de 337 millions de paramètres, tous actifs. Fondé sur BERT et cl-nagoya/ruri-pt-large, il accepte des séquences allant jusqu’à 512 tokens.
Le modèle produit des vecteurs denses de 1024 dimensions par pooling moyen des tokens et mesure leur proximité par similarité cosinus. Il sert notamment à la recherche sémantique, au RAG, à la détection de similarités et au clustering de textes japonais. Les préfixes « クエリ: » et « 文章: » distinguent respectivement les requêtes des passages.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | cl-nagoya |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 28 août 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 337 millions |
| Paramètres actifs | 337 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Japanese | 67,5 % | 17ᵉ / 20 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Japanese
Notre analyse
Forces. cl-nagoya/ruri-large couvre plusieurs familles de tâches japonaises évaluées par MTEB, notamment le clustering, la classification et la similarité sémantique. Son architecture Sentence Transformer permet de comparer directement requêtes et documents dans un espace vectoriel dense. La fenêtre de 512 tokens convient aux passages de taille modérée, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. Les préfixes dédiés aux requêtes et aux passages structurent explicitement les usages de recherche.
Limites et points d'attention. Son résultat global sur MTEB: Japanese le place dans le bas du classement évalué, ce qui suggère des performances désormais moins compétitives. Avec environ deux ans d’ancienneté, il appartient à une génération déjà très ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et susceptible de ne plus figurer dans les catalogues courants. Les vecteurs de 1024 dimensions alourdissent l’index, la mémoire et le calcul de recherche, tandis que la limite de 512 tokens impose de segmenter les documents longs. Usages pertinents : recherche sémantique, RAG, similarité et clustering sur des corpus japonais de longueur modérée.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).