Omartificial-Intelligence-Space/Arabert-all-nli-triplet-Matryoshka
Publié par Omartificial-Intelligence-Space sous licence ouverte Apache 2.0, Arabert-all-nli-triplet-Matryoshka est un modèle d’embedding de 135 millions de paramètres, spécialisé dans la représentation de textes arabes. Affiné à partir de BERT-base AraBERT v0.2, il accepte des séquences…
Publié par Omartificial-Intelligence-Space sous licence ouverte Apache 2.0, Arabert-all-nli-triplet-Matryoshka est un modèle d’embedding de 135 millions de paramètres, spécialisé dans la représentation de textes arabes. Affiné à partir de BERT-base AraBERT v0.2, il accepte des séquences atteignant 512 tokens.
Il produit par pooling moyen des vecteurs denses de 768 dimensions, comparés par similarité cosinus. Son entraînement Matryoshka autorise aussi des représentations tronquées à 512, 256, 128 ou 64 dimensions. Il cible notamment la recherche sémantique, l’indexation pour le RAG, la détection de paraphrases, la classification et le clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Omartificial-Intelligence-Space |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 16 juin 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense avec dimensions Matryoshka 768, 512, 256, 128 et 64 |
| Paramètres | 135 millions |
| Paramètres actifs | 135 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 8,4 % | 187ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 12,5 % | 158ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 13,3 % | 199ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 10,4 % | 150ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 16,4 % | 147ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 32,1 % | 124ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 0,9 % | 204ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 4,7 % | 192ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 31,2 % | 111ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: French | 29,4 % | 110ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 25,3 % | 88ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 25,3 % | 106ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. L’architecture Matryoshka constitue son principal atout pratique : la dimension peut être réduite selon le compromis recherché entre qualité, taille de l’index et coût de recherche. La fenêtre de 512 tokens permet de traiter des passages relativement développés. Parmi les évaluations MTEB disponibles, ses résultats les moins faibles concernent les ensembles European et Indic, couvrant notamment le bitext mining et la classification. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d’attention. Les classements MTEB placent le modèle près du bas du tableau sur toutes les pistes rapportées, avec des faiblesses particulièrement marquées en russe, mais aussi en allemand, néerlandais et français. La représentation complète de 768 dimensions alourdit davantage les index et les calculs de similarité que les variantes Matryoshka réduites. Sorti en juin 2024, il appartient à une génération désormais ancienne à l’échelle de l’IA et est probablement dépassé par des embeddings plus récents de sa spécialité. Usages pertinents : prototypes auto-hébergés centrés sur l’arabe, recherche sémantique, détection de paraphrases et clustering avec dimension ajustable.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).