Omartificial-Intelligence-Space/Arabic-labse-Matryoshka

Publié le 16 juin 2024 par Omartificial-Intelligence-Space, Arabic-labse-Matryoshka est un modèle d’embedding multilingue de 471 millions de paramètres, affiné à partir de LaBSE sur des triplets en arabe. Il traite jusqu’à 256 jetons et produit des vecteurs denses de 768 dimensions.

Publié le 16 juin 2024 par Omartificial-Intelligence-Space, Arabic-labse-Matryoshka est un modèle d’embedding multilingue de 471 millions de paramètres, affiné à partir de LaBSE sur des triplets en arabe. Il traite jusqu’à 256 jetons et produit des vecteurs denses de 768 dimensions.

Sa représentation Matryoshka peut être ramenée à 512, 256, 128 ou 64 dimensions. Le modèle sert à la recherche sémantique, à l’indexation pour le RAG, à la détection de paraphrases, à la classification et au clustering. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurOmartificial-Intelligence-Space
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie16 juin 2024
Dimension du vecteur768
Représentationdense Matryoshka aux dimensions 768, 512, 256, 128 et 64
Paramètres471 millions
Paramètres actifs471 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR23,2 %175ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval22,9 %144ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal29,2 %149ᵉ / 208mteb✅ Mesuré
MTEB: Medical31,7 %111ᵉ / 158mteb✅ Mesuré
MTEB: Legal35,9 %107ᵉ / 157mteb✅ Mesuré
MTEB: European54,1 %40ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French20,8 %125ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German20,2 %120ᵉ / 209mteb✅ Mesuré
MTEB: Indic63,0 %20ᵉ / 119mteb✅ Mesuré
MTEB: Korean53,1 %26ᵉ / 102mteb✅ Mesuré
MTEB: French52,5 %45ᵉ / 117mteb✅ Mesuré
MTEB: Russian51,4 %42ᵉ / 104mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ Omartificial-Intelligen…23 %
aari1995/German_Semanti…18 %

MTEB: Long-context Retrieval

▶ Omartificial-Intelligen…23 %
Gameselo/STS-multilingu…20 %

Notre analyse

Forces. Le meilleur résultat MTEB apparaît sur le track Indic, consacré à la qualité multilingue sur des tâches comprenant le bitext mining et la classification. Le modèle se place aussi relativement bien sur les tracks Korean et German, qui couvrent notamment classification, clustering, reranking et retrieval. L’entraînement combine MatryoshkaLoss et MultipleNegativesRankingLoss, avec une similarité cosinus. La représentation Matryoshka constitue un atout pratique : les vecteurs peuvent être tronqués jusqu’à 64 dimensions afin d’alléger l’index et d’accélérer la recherche, au prix d’une représentation moins riche.

Limites et points d’attention. Les résultats European, French et Russian se situent plus bas dans leurs classements respectifs, ce qui invite à valider la qualité sur les corpus et langues ciblés. La limite de 256 jetons correspond à des phrases et paragraphes plutôt qu’à de longs documents, qui doivent être découpés. À pleine dimension, les vecteurs de 768 composantes rendent aussi l’index plus lourd que les variantes Matryoshka réduites. Lancé en 2024, le modèle appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique multilingue, RAG sur passages courts, paraphrases, classification et clustering, notamment avec des contraintes d’auto-hébergement ou de taille d’index.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).