sbintuitions/sarashina-embedding-v2-1b
Publié le 30 juillet 2025 par sbintuitions, sbintuitions/sarashina-embedding-v2-1b est un modèle japonais d’embeddings dense de 1 milliard de paramètres, fondé sur Sarashina2.2-1B. Sa distribution est encadrée par une licence publiée par l’éditeur.
Publié le 30 juillet 2025 par sbintuitions, sbintuitions/sarashina-embedding-v2-1b est un modèle japonais d’embeddings dense de 1 milliard de paramètres, fondé sur Sarashina2.2-1B. Sa distribution est encadrée par une licence publiée par l’éditeur.
Son architecture LlamaModel accepte jusqu’à 8 192 tokens et produit des vecteurs de 1 792 dimensions par pooling sur le dernier token. Ces représentations, comparées par similarité cosinus, servent notamment à la recherche sémantique, au RAG, à la détection de paraphrases, à la classification et au clustering de textes japonais.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | sbintuitions |
| Poids | 🟢 Poids ouverts |
| Licence | https://huggingface.co/sbintuitions/sarashina-embedding-v2-1b/blob/main/LICENSE |
| Date de sortie | 30 juillet 2025 |
| Dimension du vecteur | 1 792 |
| Représentation | dense |
| Paramètres | 1 milliards |
| Paramètres actifs | 1 milliards |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Japanese | 73,2 % | 5ᵉ / 20 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Japanese
Notre analyse
Forces. Le résultat obtenu sur MTEB Japanese place le modèle dans le top 10 du classement évaluant conjointement clustering, classification et similarité sémantique. Cette position signale une qualité solide et polyvalente pour structurer, rapprocher ou retrouver des contenus japonais. La longueur maximale de 8 192 tokens facilite l’encodage de documents relativement longs sans découpage excessif. Les préfixes d’instruction distincts pour requêtes et documents répondent directement aux besoins des systèmes de recherche et de RAG. L’apprentissage contrastif en plusieurs étapes combine données faiblement supervisées, fine-tuning supervisé et fusion linéaire de deux modèles.
Limites et points d’attention. La spécialisation annoncée concerne le japonais, ce qui réserve son positionnement aux corpus et requêtes dans cette langue. Les vecteurs de 1 792 dimensions peuvent alourdir les index et rendre la recherche plus coûteuse que des représentations de dimension inférieure, particulièrement à grande échelle. Le modèle compte également 1 milliard de paramètres actifs, un facteur à intégrer au déploiement de l’encodeur. Usages pertinents : recherche sémantique et RAG en japonais, détection de paraphrases, classification de textes et clustering de corpus longs.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).