sbintuitions/sarashina-embedding-v1-1b

Publié par sbintuitions le 22 novembre 2024, sbintuitions/sarashina-embedding-v1-1b est un modèle d’embedding japonais de 1 milliard de paramètres actifs, fondé sur Sarashina2.1-1B. Son architecture LlamaModel produit, par pooling sur le dernier token, des vecteurs denses de 1 792…

Publié par sbintuitions le 22 novembre 2024, sbintuitions/sarashina-embedding-v1-1b est un modèle d’embedding japonais de 1 milliard de paramètres actifs, fondé sur Sarashina2.1-1B. Son architecture LlamaModel produit, par pooling sur le dernier token, des vecteurs denses de 1 792 dimensions.

Sa fenêtre de 8 192 tokens permet de représenter des phrases comme des paragraphes relativement longs. La comparaison repose sur la similarité cosinus, sans préfixes « Query: » ou « Document: ». Le modèle cible notamment la recherche sémantique, l’indexation pour le RAG, la détection de paraphrases, la classification et le clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeursbintuitions
Poids🟢 Poids ouverts
Licencehttps://huggingface.co/sbintuitions/sarashina-embedding-v1-1b/blob/main/LICENSE
Date de sortie22 novembre 2024
Dimension du vecteur1 792
Représentationdense
Paramètres1 milliards
Paramètres actifs1 milliards
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Japanese69,5 %12ᵉ / 20mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Son principal intérêt réside dans le traitement sémantique du japonais. L’évaluation MTEB: Japanese couvre la classification, le clustering et la similarité sémantique, ce qui atteste une certaine polyvalence plutôt qu’une spécialisation dans une seule tâche. La séquence maximale de 8 192 tokens facilite l’encodage de passages étendus et de portions substantielles de documents. L’absence de préfixes distincts pour les requêtes et les documents simplifie aussi les pipelines d’indexation et de comparaison.

Limites et points d’attention. Son classement dans la seconde moitié des modèles évalués sur MTEB: Japanese le situe derrière plusieurs concurrents de sa période. Les vecteurs de 1 792 dimensions alourdissent les index et rendent le stockage ainsi que la recherche plus coûteux que des représentations plus compactes. Le milliard de paramètres actifs implique également davantage de calcul à l’encodage. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle est probablement dépassé par des solutions japonaises plus récentes et peut avoir quitté les catalogues courants. Usages pertinents : recherche sémantique japonaise, RAG, similarité, classification et clustering de textes japonais.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).