HIT-TMG/KaLM-embedding-multilingual-mini-v1

Publié par HIT-TMG le 27 août 2024 sous licence ouverte MIT, KaLM-embedding-multilingual-mini-v1 est un modèle d’embedding multilingue de 494 millions de paramètres, adapté d’un modèle auto-régressif et entraîné à partir de Qwen2-0.5B. Il produit des vecteurs de 896 dimensions et accepte…

Publié par HIT-TMG le 27 août 2024 sous licence ouverte MIT, KaLM-embedding-multilingual-mini-v1 est un modèle d’embedding multilingue de 494 millions de paramètres, adapté d’un modèle auto-régressif et entraîné à partir de Qwen2-0.5B. Il produit des vecteurs de 896 dimensions et accepte des séquences allant jusqu’à 512.

Le modèle transforme les textes en représentations numériques avec sentence-transformers et model.encode, avec normalisation optionnelle. Ces vecteurs servent notamment à la recherche sémantique, à la sélection de passages pour le RAG, au calcul de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurHIT-TMG
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie27 août 2024
Dimension du vecteur896
Représentationvecteurs d'embedding via sentence-transformers model.encode
Paramètres494 millions
Paramètres actifs494 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR50,8 %93ᵉ / 192mteb✅ Mesuré
MTEB: BEIR-NL40,5 %10ᵉ / 16mteb✅ Mesuré
MTEB: Long-context Retrieval43,2 %55ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal43,5 %70ᵉ / 208mteb✅ Mesuré
MTEB: Medical57,3 %29ᵉ / 158mteb✅ Mesuré
MTEB: Legal53,9 %36ᵉ / 157mteb✅ Mesuré
MTEB: European57,6 %31ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French40,9 %71ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German41,9 %79ᵉ / 209mteb✅ Mesuré
MTEB: Chinese62,3 %43ᵉ / 58mteb✅ Mesuré
MTEB: Indic58,6 %33ᵉ / 119mteb✅ Mesuré
MTEB: German53,4 %17ᵉ / 96mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ HIT-TMG/KaLM-embedding-…51 %
dwzhu/e5-base-4k50 %

MTEB: BEIR-NL

▶ HIT-TMG/KaLM-embedding-…41 %

Notre analyse

Forces. Les résultats MTEB montrent son meilleur positionnement relatif sur les tâches en allemand, ainsi qu’une tenue correcte sur les ensembles européens, indic, médicaux et juridiques. Cette couverture convient aux systèmes multilingues combinant recherche, classification, clustering et rapprochement de textes. L’entraînement associe un pré-entraînement faiblement supervisé massif à un ajustement supervisé. Des instructions peuvent être ajoutées côté requête pour la classification et le clustering, sans instruction côté corpus. La licence MIT facilite l’intégration, la modification et l’auto-hébergement.

Limites et points d’attention. Le track Chinese constitue son positionnement relatif le plus faible, tandis que les autres classements restent éloignés des toutes premières places. Une longueur maximale de 512 impose généralement de segmenter les documents longs avant indexation. Les vecteurs de 896 dimensions alourdissent aussi l’index et les calculs de similarité par rapport à des représentations plus petites. Sorti en 2024, ce modèle est ancien à l’échelle de l’IA et probablement dépassé par des solutions plus récentes de sa catégorie. Usages pertinents : recherche sémantique multilingue, RAG sur passages courts, clustering et classification avec instructions côté requête.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).