cl-nagoya

Ruri : des embeddings de texte japonais issus de la recherche de l'Université de Nagoya

8 fiches modèlesorties 28 août 2024 → 9 avril 20258 à poids ouvertscontexte jusqu'à 8 192 tokens

Le compte cl-nagoya correspond à un laboratoire de traitement automatique des langues rattaché à l'Université de Nagoya, au Japon. Ses travaux visent à combler un manque persistant : le développement de modèles d'embeddings de texte reste moins avancé en japonais qu'en anglais ou dans les grands modèles multilingues, faute de jeux de données et d'expertise dédiés. Le laboratoire publie ses modèles et ses données en accès ouvert sur Hugging Face, dans une logique de recherche académique.

Sa contribution la plus visible est la famille Ruri, des modèles généralistes d'embeddings de texte japonais. Le catalogue en présente ruri-v3-310m, une version bâtie sur l'architecture ModernBERT-Ja, qui étend la longueur de contexte prise en charge jusqu'à 8 192 tokens et élargit le vocabulaire par rapport aux générations précédentes.

Ces modèles servent la recherche sémantique, la récupération d'information et le RAG en langue japonaise, avec un intérêt particulier pour les projets nécessitant une bonne couverture linguistique du japonais.

Modèles

Modèles Embedding