HIT-TMG/KaLM-embedding-multilingual-mini-v1
Publié par HIT-TMG le 27 août 2024 sous licence ouverte MIT, KaLM-embedding-multilingual-mini-v1 est un modèle d’embedding multilingue de 494 millions de paramètres, adapté d’un modèle auto-régressif et entraîné à partir de Qwen2-0.5B. Il produit des vecteurs de 896 dimensions et accepte…
Publié par HIT-TMG le 27 août 2024 sous licence ouverte MIT, KaLM-embedding-multilingual-mini-v1 est un modèle d’embedding multilingue de 494 millions de paramètres, adapté d’un modèle auto-régressif et entraîné à partir de Qwen2-0.5B. Il produit des vecteurs de 896 dimensions et accepte des séquences allant jusqu’à 512.
Le modèle transforme les textes en représentations numériques avec sentence-transformers et model.encode, avec normalisation optionnelle. Ces vecteurs servent notamment à la recherche sémantique, à la sélection de passages pour le RAG, au calcul de similarité et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | HIT-TMG |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 27 août 2024 |
| Dimension du vecteur | 896 |
| Représentation | vecteurs d'embedding via sentence-transformers model.encode |
| Paramètres | 494 millions |
| Paramètres actifs | 494 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 50,8 % | 93ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: BEIR-NL | 40,5 % | 10ᵉ / 16 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 43,2 % | 55ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 43,5 % | 70ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 57,3 % | 29ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 53,9 % | 36ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 57,6 % | 31ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 40,9 % | 71ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 41,9 % | 79ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chinese | 62,3 % | 43ᵉ / 58 | mteb | ✅ Mesuré |
| MTEB: Indic | 58,6 % | 33ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: German | 53,4 % | 17ᵉ / 96 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: BEIR-NL
Notre analyse
Forces. Les résultats MTEB montrent son meilleur positionnement relatif sur les tâches en allemand, ainsi qu’une tenue correcte sur les ensembles européens, indic, médicaux et juridiques. Cette couverture convient aux systèmes multilingues combinant recherche, classification, clustering et rapprochement de textes. L’entraînement associe un pré-entraînement faiblement supervisé massif à un ajustement supervisé. Des instructions peuvent être ajoutées côté requête pour la classification et le clustering, sans instruction côté corpus. La licence MIT facilite l’intégration, la modification et l’auto-hébergement.
Limites et points d’attention. Le track Chinese constitue son positionnement relatif le plus faible, tandis que les autres classements restent éloignés des toutes premières places. Une longueur maximale de 512 impose généralement de segmenter les documents longs avant indexation. Les vecteurs de 896 dimensions alourdissent aussi l’index et les calculs de similarité par rapport à des représentations plus petites. Sorti en 2024, ce modèle est ancien à l’échelle de l’IA et probablement dépassé par des solutions plus récentes de sa catégorie. Usages pertinents : recherche sémantique multilingue, RAG sur passages courts, clustering et classification avec instructions côté requête.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).