Omartificial-Intelligence-Space/Arabic-all-nli-triplet-Matryoshka

Publié par Omartificial-Intelligence-Space sous licence ouverte Apache 2.0, Arabic-all-nli-triplet-Matryoshka est un modèle d’embedding multilingue de 278 millions de paramètres fondé sur XLM-RoBERTa. Il convertit des séquences allant jusqu’à 128 tokens en vecteurs denses de 768…

Publié par Omartificial-Intelligence-Space sous licence ouverte Apache 2.0, Arabic-all-nli-triplet-Matryoshka est un modèle d’embedding multilingue de 278 millions de paramètres fondé sur XLM-RoBERTa. Il convertit des séquences allant jusqu’à 128 tokens en vecteurs denses de 768 dimensions par mean pooling.

Affiné à partir de paraphrase-multilingual-mpnet-base-v2 sur un jeu de triplets arabes, il mesure la proximité des textes par similarité cosinus. Ses représentations Matryoshka peuvent être réduites à 512, 256, 128 ou 64 dimensions pour la recherche sémantique, le RAG, la détection de paraphrases, la classification et le clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurOmartificial-Intelligence-Space
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie14 juin 2024
Dimension du vecteur768
Représentationdense avec dimensions Matryoshka 768, 512, 256, 128 et 64
Paramètres278 millions
Paramètres actifs278 millions
Longueur de séquence max514 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR32,1 %159ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval20,8 %149ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal27,5 %160ᵉ / 208mteb✅ Mesuré
MTEB: Medical37,2 %96ᵉ / 158mteb✅ Mesuré
MTEB: Legal35,0 %117ᵉ / 157mteb✅ Mesuré
MTEB: European54,1 %41ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French28,0 %97ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German16,7 %129ᵉ / 209mteb✅ Mesuré
MTEB: Indic59,0 %32ᵉ / 119mteb✅ Mesuré
MTEB: Korean57,2 %23ᵉ / 102mteb✅ Mesuré
MTEB: French53,3 %41ᵉ / 117mteb✅ Mesuré
MTEB: Russian52,8 %40ᵉ / 104mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ Omartificial-Intelligen…32 %

MTEB: Long-context Retrieval

▶ Omartificial-Intelligen…21 %
Gameselo/STS-multilingu…20 %

Notre analyse

Forces. Les résultats MTEB sont les plus favorables sur le track Korean, où le modèle se place dans le premier quart du classement, puis sur Indic. Ils indiquent une aptitude multilingue couvrant notamment la classification, le reranking, la recherche, le bitext mining et le clustering selon les tracks. L’affinage sur des triplets arabes cible également la similarité sémantique et les paraphrases en arabe. Les dimensions Matryoshka permettent de réduire les vecteurs jusqu’à 64 dimensions, ce qui peut alléger les index et accélérer la recherche au prix d’une représentation moins complète. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d’attention. Les tracks European, French et Russian placent le modèle autour du milieu de leurs classements, tandis que Dutch constitue son résultat relatif le plus faible. La limite de 128 tokens convient davantage aux phrases et passages courts qu’aux documents longs. À 768 dimensions, l’index complet demande davantage de stockage et de calcul que les variantes Matryoshka réduites. Sorti en juin 2024, il est ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents de sa catégorie. Usages pertinents : recherche sémantique multilingue, RAG par passages courts, détection de paraphrases, classification et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).