Omartificial-Intelligence-Space/Marbert-all-nli-triplet-Matryoshka
Publié le 17 juin 2024 par Omartificial-Intelligence-Space, Marbert-all-nli-triplet-Matryoshka est un modèle d’embedding dense de 163 millions de paramètres, tous actifs. Affiné à partir de MARBERTv2 sur des triplets en arabe, il produit par défaut des vecteurs de 768 dimensions.
Publié le 17 juin 2024 par Omartificial-Intelligence-Space, Marbert-all-nli-triplet-Matryoshka est un modèle d’embedding dense de 163 millions de paramètres, tous actifs. Affiné à partir de MARBERTv2 sur des triplets en arabe, il produit par défaut des vecteurs de 768 dimensions.
Ce Sentence Transformer utilise un pooling moyen et la similarité cosinus. Ses représentations servent à la recherche sémantique, à la couche de recherche d’un système RAG, à la détection de paraphrases, à la classification et au clustering. Sa licence ouverte Apache 2.0 autorise l’auto-hébergement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Omartificial-Intelligence-Space |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 17 juin 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense (dimensions Matryoshka : 768, 512, 256, 128 et 64) |
| Paramètres | 163 millions |
| Paramètres actifs | 163 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 7,3 % | 189ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 9,1 % | 159ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 12,4 % | 201ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 7,5 % | 156ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 11,8 % | 152ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 30,6 % | 125ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 0,4 % | 208ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 3,1 % | 202ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 30,3 % | 115ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: French | 29,6 % | 109ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Dutch | 23,4 % | 109ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: German | 23,1 % | 93ᵉ / 96 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. L’entraînement avec MatryoshkaLoss permet de réduire les embeddings de 768 à 512, 256, 128 ou 64 dimensions. Cette flexibilité facilite l’arbitrage entre richesse de représentation, taille de l’index et coût de la recherche. Le modèle couvre plusieurs usages de comparaison sémantique, notamment la recherche, les paraphrases, la classification et le clustering. Parmi les évaluations MTEB fournies, ses résultats les moins faibles concernent les ensembles European, Indic et French, sans toutefois le placer parmi les modèles les plus performants de ces classements.
Limites et points d'attention. Les rangs obtenus sont proches du bas des classements MTEB sur l’ensemble des langues évaluées. Les résultats sont particulièrement faibles sur les tracks Dutch, German et Russian, tandis que French, European et Indic restent également peu compétitifs. La représentation complète de 768 dimensions produit un index plus lourd et une recherche plus coûteuse que les variantes Matryoshka réduites. Sorti en 2024, le modèle est ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents de sa catégorie. Usages pertinents : prototypes auto-hébergés, recherche sémantique en arabe et expérimentations nécessitant plusieurs tailles de vecteurs.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).