Omartificial-Intelligence-Space/Arabic-labse-Matryoshka
Publié le 16 juin 2024 par Omartificial-Intelligence-Space, Arabic-labse-Matryoshka est un modèle d’embedding multilingue de 471 millions de paramètres, affiné à partir de LaBSE sur des triplets en arabe. Il traite jusqu’à 256 jetons et produit des vecteurs denses de 768 dimensions.
Publié le 16 juin 2024 par Omartificial-Intelligence-Space, Arabic-labse-Matryoshka est un modèle d’embedding multilingue de 471 millions de paramètres, affiné à partir de LaBSE sur des triplets en arabe. Il traite jusqu’à 256 jetons et produit des vecteurs denses de 768 dimensions.
Sa représentation Matryoshka peut être ramenée à 512, 256, 128 ou 64 dimensions. Le modèle sert à la recherche sémantique, à l’indexation pour le RAG, à la détection de paraphrases, à la classification et au clustering. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Omartificial-Intelligence-Space |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 16 juin 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense Matryoshka aux dimensions 768, 512, 256, 128 et 64 |
| Paramètres | 471 millions |
| Paramètres actifs | 471 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 23,2 % | 175ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 22,9 % | 144ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 29,2 % | 149ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 31,7 % | 111ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 35,9 % | 107ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 54,1 % | 40ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 20,8 % | 125ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 20,2 % | 120ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 63,0 % | 20ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Korean | 53,1 % | 26ᵉ / 102 | mteb | ✅ Mesuré |
| MTEB: French | 52,5 % | 45ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Russian | 51,4 % | 42ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur résultat MTEB apparaît sur le track Indic, consacré à la qualité multilingue sur des tâches comprenant le bitext mining et la classification. Le modèle se place aussi relativement bien sur les tracks Korean et German, qui couvrent notamment classification, clustering, reranking et retrieval. L’entraînement combine MatryoshkaLoss et MultipleNegativesRankingLoss, avec une similarité cosinus. La représentation Matryoshka constitue un atout pratique : les vecteurs peuvent être tronqués jusqu’à 64 dimensions afin d’alléger l’index et d’accélérer la recherche, au prix d’une représentation moins riche.
Limites et points d’attention. Les résultats European, French et Russian se situent plus bas dans leurs classements respectifs, ce qui invite à valider la qualité sur les corpus et langues ciblés. La limite de 256 jetons correspond à des phrases et paragraphes plutôt qu’à de longs documents, qui doivent être découpés. À pleine dimension, les vecteurs de 768 composantes rendent aussi l’index plus lourd que les variantes Matryoshka réduites. Lancé en 2024, le modèle appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique multilingue, RAG sur passages courts, paraphrases, classification et clustering, notamment avec des contraintes d’auto-hébergement ou de taille d’index.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).