cl-nagoya/ruri-large-v2
Publié par cl-nagoya le 6 décembre 2024, cl-nagoya/ruri-large-v2 est un modèle d’embedding japonais de 337 millions de paramètres, sous licence ouverte Apache 2.0. Fondé sur une architecture BERT, il transforme des séquences de 512 tokens au maximum en vecteurs denses de 1024 dimensions…
Publié par cl-nagoya le 6 décembre 2024, cl-nagoya/ruri-large-v2 est un modèle d’embedding japonais de 337 millions de paramètres, sous licence ouverte Apache 2.0. Fondé sur une architecture BERT, il transforme des séquences de 512 tokens au maximum en vecteurs denses de 1024 dimensions grâce à un pooling moyen des tokens.
Conçu à partir de cl-nagoya/ruri-pt-large-v2, il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering de textes japonais. La comparaison repose sur la similarité cosinus, avec les préfixes « クエリ: » pour les requêtes et « 文章: » pour les passages.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | cl-nagoya |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 6 décembre 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 337 millions |
| Paramètres actifs | 337 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Japanese | 69,5 % | 13ᵉ / 20 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Japanese
Notre analyse
Forces. Son évaluation MTEB: Japanese couvre plusieurs usages complémentaires, notamment le clustering, la classification et la similarité sémantique. Le résultat global le place toutefois plutôt dans la seconde moitié des modèles évalués que parmi les meilleurs. Ses 337 millions de paramètres actifs offrent une architecture relativement contenue, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. La distinction explicite entre requêtes et passages est adaptée aux moteurs de recherche sémantique et aux systèmes RAG en japonais. Les caractéristiques principales sont corroborées par deux sources concordantes.
Limites et points d’attention. Les vecteurs denses de 1024 dimensions alourdissent l’index et augmentent le coût de stockage et de recherche par rapport à des représentations plus compactes. La limite de 512 tokens impose de découper les documents longs avant leur indexation. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, le modèle doit être comparé aux références de sa période et peut désormais être dépassé, voire retiré des catalogues courants. Usages pertinents : recherche sémantique, RAG, similarité et regroupement de contenus japonais de longueur modérée.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).