Omartificial-Intelligence-Space/Arabic-MiniLM-L12-v2-all-nli-triplet

Publié le 25 juin 2024 par Omartificial-Intelligence-Space, Arabic-MiniLM-L12-v2-all-nli-triplet est un modèle d'embedding multilingue de 118 millions de paramètres actifs. Issu de paraphrase-multilingual-MiniLM-L12-v2 et affiné sur arabic-n_li-triplet, il produit des vecteurs denses de…

Publié le 25 juin 2024 par Omartificial-Intelligence-Space, Arabic-MiniLM-L12-v2-all-nli-triplet est un modèle d'embedding multilingue de 118 millions de paramètres actifs. Issu de paraphrase-multilingual-MiniLM-L12-v2 et affiné sur arabic-n_li-triplet, il produit des vecteurs denses de 384 dimensions avec une séquence maximale de 128 tokens.

Le modèle sert à indexer des phrases ou de courts paragraphes pour la recherche sémantique, la récupération de passages en RAG, la détection de paraphrases, la classification et le clustering. Sa licence ouverte Apache 2.0 autorise notamment l'auto-hébergement et l'intégration dans des applications commerciales.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurOmartificial-Intelligence-Space
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie25 juin 2024
Dimension du vecteur384
Représentationdense
Paramètres118 millions
Paramètres actifs118 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR27,9 %165ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval17,9 %154ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal25,2 %172ᵉ / 208mteb✅ Mesuré
MTEB: Medical33,2 %104ᵉ / 158mteb✅ Mesuré
MTEB: Legal33,2 %123ᵉ / 157mteb✅ Mesuré
MTEB: European51,7 %48ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French19,0 %133ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German13,9 %151ᵉ / 209mteb✅ Mesuré
MTEB: Indic54,3 %40ᵉ / 119mteb✅ Mesuré
MTEB: Korean51,2 %27ᵉ / 102mteb✅ Mesuré
MTEB: French49,6 %60ᵉ / 117mteb✅ Mesuré
MTEB: Russian48,6 %47ᵉ / 104mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ Omartificial-Intelligen…28 %

MTEB: Long-context Retrieval

▶ Omartificial-Intelligen…18 %
aari1995/German_Semanti…18 %

Notre analyse

Forces. Les évaluations MTEB montrent une couverture multilingue effective. Le modèle obtient son meilleur positionnement relatif sur le track Korean, tandis que les tracks Indic et European figurent parmi ses résultats les plus solides en valeur absolue. Ces ensembles couvrent notamment la classification, la recherche, le reranking, le bitext mining et la similarité entre textes. L'espace dense de 384 dimensions limite la taille des index et le coût de calcul de la similarité cosinus par rapport à des représentations plus larges. L'affinage sur des triplets arabes constitue aussi une caractéristique adaptée au rapprochement sémantique de phrases.

Limites et points d'attention. Les résultats MTEB restent globalement en milieu de classement, avec des performances plus faibles sur les tracks French, Russian et surtout Dutch que sur Indic, European et Korean. La limite de 128 tokens impose de découper les documents longs en segments avant indexation, ce qui rend ce modèle peu adapté à l'encodage direct de longs passages. Sorti il y a près de deux ans, il est ancien à l'échelle de l'IA et probablement dépassé par des embeddings plus récents de sa catégorie. Usages pertinents : recherche sémantique multilingue sur textes courts, récupération de passages pour le RAG, détection de paraphrases et clustering avec un index compact auto-hébergé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).