cl-nagoya/ruri-v3-310m
Publié par cl-nagoya le 9 avril 2025 sous licence ouverte Apache 2.0, cl-nagoya/ruri-v3-310m est un modèle généraliste d’embeddings japonais de 315 millions de paramètres. Construit sur ModernBERT-Ja, il produit des représentations denses de 768 dimensions avec pooling moyen et…
Publié par cl-nagoya le 9 avril 2025 sous licence ouverte Apache 2.0, cl-nagoya/ruri-v3-310m est un modèle généraliste d’embeddings japonais de 315 millions de paramètres. Construit sur ModernBERT-Ja, il produit des représentations denses de 768 dimensions avec pooling moyen et comparaison par similarité cosinus.
Fourni au format Sentence Transformer, il encode jusqu’à 8 192 tokens et emploie un vocabulaire de 100 000 tokens fondé uniquement sur SentencePiece. Il sert notamment à la recherche sémantique, au RAG, à la mesure de similarité, à la classification et au clustering de textes japonais.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | cl-nagoya |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 9 avril 2025 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 315 millions |
| Paramètres actifs | 315 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Japanese | 72,4 % | 8ᵉ / 20 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Japanese
Notre analyse
Forces. Son résultat au MTEB Japanese le place dans le top 10 de cette évaluation, qui couvre notamment le clustering, la classification et la similarité sémantique. Sa fenêtre de 8 192 tokens favorise l’encodage de documents relativement longs, tandis que FlashAttention facilite le traitement de ces séquences. La dimension de 768 offre un compromis pratique entre richesse de représentation et poids des index. Des préfixes distincts adaptent l’encodage aux requêtes, aux documents de recherche, à la classification, au clustering et aux sujets. La licence Apache 2.0 autorise par ailleurs l’auto-hébergement et l’intégration dans des services commerciaux.
Limites et points d’attention. Le modèle est spécialisé dans le japonais plutôt que présenté comme multilingue. Ses 315 millions de paramètres impliquent davantage de calcul qu’un encodeur plus petit, et les préfixes attendus doivent être appliqués conformément au type de tâche afin de conserver un encodage adapté. Sorti il y a environ un an, il est déjà ancien à l’échelle rapide de l’IA et peut être dépassé par des modèles japonais plus récents. Usages pertinents : recherche sémantique japonaise, RAG sur documents longs, détection de similarité, classification et clustering thématique.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).