HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1

Publié par HIT-TMG le 23 octobre 2024 sous licence ouverte MIT, HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1 est un modèle d’embedding multilingue dense de 494 millions de paramètres, tous actifs. Adapté de Qwen2-0.5B, il produit des vecteurs de 896 dimensions.

Publié par HIT-TMG le 23 octobre 2024 sous licence ouverte MIT, HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1 est un modèle d’embedding multilingue dense de 494 millions de paramètres, tous actifs. Adapté de Qwen2-0.5B, il produit des vecteurs de 896 dimensions.

Le modèle sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Entraîné par préentraînement faiblement supervisé puis ajustement supervisé, il encode les phrases avec Sentence Transformers et prend en charge la normalisation des représentations. Une instruction peut être ajoutée aux requêtes de classification et de clustering, tandis que le corpus reste sans instruction.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurHIT-TMG
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie23 octobre 2024
Dimension du vecteur896
Représentationdense
Paramètres494 millions
Paramètres actifs494 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR51,9 %76ᵉ / 192mteb✅ Mesuré
MTEB: BEIR-NL26,1 %12ᵉ / 16mteb✅ Mesuré
MTEB: Long-context Retrieval65,1 %26ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal46,0 %60ᵉ / 208mteb✅ Mesuré
MTEB: Medical57,3 %28ᵉ / 158mteb✅ Mesuré
MTEB: Legal54,5 %31ᵉ / 157mteb✅ Mesuré
MTEB: European57,8 %29ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French29,1 %93ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German48,8 %57ᵉ / 209mteb✅ Mesuré
MTEB: Chinese63,0 %42ᵉ / 58mteb✅ Mesuré
MTEB: French61,8 %21ᵉ / 117mteb✅ Mesuré
MTEB: Russian60,0 %26ᵉ / 104mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

llmrails/ember-v152 %
▶ HIT-TMG/KaLM-embedding-…52 %

MTEB: BEIR-NL

▶ HIT-TMG/KaLM-embedding-…26 %

Notre analyse

Forces. Les résultats MTEB placent le modèle dans une position solide sur Long-context Retrieval, ce qui indique une bonne aptitude à retrouver des passages pertinents dans des tâches synthétiques et réelles portant sur des contextes longs. Les évaluations French, European et Russian montrent une polyvalence multilingue utile pour la recherche, la classification, le clustering, le reranking et le rapprochement de textes. Le track Medical demeure également compétitif pour la recherche d’informations cliniques, biomédicales et destinées au grand public. La licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration dans des systèmes propriétaires.

Limites et points d’attention. Le track Chinese est le moins bien classé de ses évaluations linguistiques, avec une position proche du bas du classement, tandis que les résultats European et Russian restent davantage intermédiaires que dominants. Les vecteurs denses de 896 dimensions imposent un stockage et un calcul de recherche plus importants que des représentations de dimension inférieure. Avec environ deux ans d’ancienneté, une durée très longue à l’échelle de l’IA, cette génération est probablement dépassée par des modèles plus récents et peut ne plus figurer dans les catalogues actuels. Usages pertinents : RAG multilingue, recherche sémantique, clustering et indexation de contenus français, européens, russes ou médicaux.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).