Omartificial-Intelligence-Space/Arabic-mpnet-base-all-nli-triplet
Publié le 15 juin 2024 par Omartificial-Intelligence-Space, Arabic-mpnet-base-all-nli-triplet est un modèle d’embedding de 109 millions de paramètres fondé sur MPNet et affiné sur des triplets en arabe. Il produit un vecteur dense de 768 dimensions à partir de séquences atteignant 512…
Publié le 15 juin 2024 par Omartificial-Intelligence-Space, Arabic-mpnet-base-all-nli-triplet est un modèle d’embedding de 109 millions de paramètres fondé sur MPNet et affiné sur des triplets en arabe. Il produit un vecteur dense de 768 dimensions à partir de séquences atteignant 512 tokens.
Le modèle utilise un pooling moyen et la similarité cosinus. Il sert à la recherche sémantique, au RAG, à la détection de paraphrases, à la classification et au clustering. Sa licence ouverte Apache 2.0 autorise l’auto-hébergement, tandis que son entraînement Matryoshka permet aussi des représentations de 512, 256, 128 ou 64 dimensions.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Omartificial-Intelligence-Space |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 15 juin 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense (vecteur unique, dimensions Matryoshka : 768, 512, 256, 128 et 64) |
| Paramètres | 109 millions |
| Paramètres actifs | 109 millions |
| Longueur de séquence max | 514 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 10,1 % | 184ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 19,4 % | 152ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 15,5 % | 197ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 13,2 % | 145ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 20,1 % | 144ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 33,8 % | 121ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 1,1 % | 202ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 7,9 % | 185ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 34,5 % | 68ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: French | 31,1 % | 106ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 26,0 % | 86ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 25,4 % | 105ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le modèle est principalement adapté au traitement sémantique de textes arabes, conformément à son jeu d’affinage. Parmi les évaluations MTEB disponibles, ses résultats les moins faibles concernent les ensembles Indic et European, couvrant notamment le bitext mining et la classification, sans toutefois le placer parmi les meilleurs modèles de ces classements. Les dimensions Matryoshka constituent son principal atout pratique : une représentation réduite à 512, 256, 128 ou 64 dimensions peut alléger l’index et accélérer la recherche, au prix d’une perte potentielle de précision. La licence Apache 2.0 facilite l’intégration et l’auto-hébergement.
Limites et points d’attention. Les résultats MTEB sont faibles en français, en allemand, en néerlandais et en russe, avec des positions proches du bas des classements. La sortie complète de 768 dimensions alourdit davantage le stockage et le calcul de similarité que les variantes Matryoshka. La limite de 512 tokens convient aux phrases et paragraphes, mais impose un découpage des documents longs pour le RAG. Sorti en juin 2024, le modèle est ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents, les modèles de cette période étant aussi souvent retirés des catalogues. Usages pertinents : recherche sémantique, paraphrases, classification et clustering de contenus principalement arabes, avec déploiement local.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).