sbintuitions/sarashina-embedding-v2-1b

Publié le 30 juillet 2025 par sbintuitions, sbintuitions/sarashina-embedding-v2-1b est un modèle japonais d’embeddings dense de 1 milliard de paramètres, fondé sur Sarashina2.2-1B. Sa distribution est encadrée par une licence publiée par l’éditeur.

Publié le 30 juillet 2025 par sbintuitions, sbintuitions/sarashina-embedding-v2-1b est un modèle japonais d’embeddings dense de 1 milliard de paramètres, fondé sur Sarashina2.2-1B. Sa distribution est encadrée par une licence publiée par l’éditeur.

Son architecture LlamaModel accepte jusqu’à 8 192 tokens et produit des vecteurs de 1 792 dimensions par pooling sur le dernier token. Ces représentations, comparées par similarité cosinus, servent notamment à la recherche sémantique, au RAG, à la détection de paraphrases, à la classification et au clustering de textes japonais.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeursbintuitions
Poids🟢 Poids ouverts
Licencehttps://huggingface.co/sbintuitions/sarashina-embedding-v2-1b/blob/main/LICENSE
Date de sortie30 juillet 2025
Dimension du vecteur1 792
Représentationdense
Paramètres1 milliards
Paramètres actifs1 milliards
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Japanese73,2 %5ᵉ / 20mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Japanese

▶ sbintuitions/sarashina-…73 %

Notre analyse

Forces. Le résultat obtenu sur MTEB Japanese place le modèle dans le top 10 du classement évaluant conjointement clustering, classification et similarité sémantique. Cette position signale une qualité solide et polyvalente pour structurer, rapprocher ou retrouver des contenus japonais. La longueur maximale de 8 192 tokens facilite l’encodage de documents relativement longs sans découpage excessif. Les préfixes d’instruction distincts pour requêtes et documents répondent directement aux besoins des systèmes de recherche et de RAG. L’apprentissage contrastif en plusieurs étapes combine données faiblement supervisées, fine-tuning supervisé et fusion linéaire de deux modèles.

Limites et points d’attention. La spécialisation annoncée concerne le japonais, ce qui réserve son positionnement aux corpus et requêtes dans cette langue. Les vecteurs de 1 792 dimensions peuvent alourdir les index et rendre la recherche plus coûteuse que des représentations de dimension inférieure, particulièrement à grande échelle. Le modèle compte également 1 milliard de paramètres actifs, un facteur à intégrer au déploiement de l’encodeur. Usages pertinents : recherche sémantique et RAG en japonais, détection de paraphrases, classification de textes et clustering de corpus longs.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).