shibing624/text2vec-base-multilingual
Publié le 22 juin 2023 par shibing624, shibing624/text2vec-base-multilingual est un modèle d’embedding multilingue de 118 millions de paramètres, distribué sous licence ouverte Apache 2.0. Fondé sur sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2, il produit par mean pooling…
Publié le 22 juin 2023 par shibing624, shibing624/text2vec-base-multilingual est un modèle d’embedding multilingue de 118 millions de paramètres, distribué sous licence ouverte Apache 2.0. Fondé sur sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2, il produit par mean pooling des représentations denses de 384 dimensions.
Le modèle encode des phrases et de courts paragraphes dans dix langues, dont le français, l’anglais, l’allemand et le chinois. Les entrées sont tronquées au-delà de 256 word pieces. Ces vecteurs servent à la recherche sémantique, à la récupération de passages pour le RAG, au clustering, à la similarité de phrases et à la mise en correspondance de textes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | shibing624 |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 22 juin 2023 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 118 millions |
| Paramètres actifs | 118 millions |
| Longueur de séquence max | 256 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 24,7 % | 172ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 17,9 % | 153ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 21,4 % | 188ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 21,0 % | 81ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 16,8 % | 94ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 32,2 % | 107ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 30,6 % | 132ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 48,3 % | 69ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 15,8 % | 143ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 11,7 % | 169ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: German | 42,9 % | 39ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 40,6 % | 68ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB indiquent un positionnement relativement plus favorable en coréen et en allemand que sur les autres tracks évalués. La couverture européenne confirme néanmoins une aptitude multilingue exploitable pour la classification, le clustering, la recherche, le reranking et la comparaison de textes dans plusieurs langues. L’affinage CoSENT associe un objectif contrastif à une perte de classement, une combinaison adaptée au rapprochement de contenus sémantiquement voisins. Les vecteurs denses de 384 dimensions offrent un format compact, susceptible d’alléger les index par rapport à des représentations plus larges. La licence Apache 2.0 autorise par ailleurs l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d’attention. Les performances MTEB restent modestes à l’échelle européenne et néerlandaise, tandis que les tracks Medical et Legal placent le modèle près du bas de leurs classements respectifs. Il convient donc moins aux recherches spécialisées dans les corpus cliniques, biomédicaux, juridiques ou réglementaires. La troncature après 256 word pieces limite aussi la représentation directe de documents longs, qui doivent être segmentés en passages. Sorti en 2023, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de son segment. Usages pertinents : recherche sémantique multilingue généraliste, RAG sur passages courts, similarité de phrases et clustering avec un index compact auto-hébergé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).