HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v2

Publié par HIT-TMG le 25 juin 2025 sous licence ouverte MIT, KaLM-embedding-multilingual-mini-instruct-v2 est un modèle d’embedding multilingue dense de 494 millions de paramètres, dérivé de Qwen2-0.5B avec une attention bidirectionnelle. Il accepte jusqu’à 32k tokens et produit par…

Publié par HIT-TMG le 25 juin 2025 sous licence ouverte MIT, KaLM-embedding-multilingual-mini-instruct-v2 est un modèle d’embedding multilingue dense de 494 millions de paramètres, dérivé de Qwen2-0.5B avec une attention bidirectionnelle. Il accepte jusqu’à 32k tokens et produit par défaut des vecteurs de dimension 896.

Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, au reranking, à la classification, à la similarité et au clustering. Des instructions adaptées aux tâches peuvent orienter l’encodage. Il fonctionne avec sentence-transformers et vLLM.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurHIT-TMG
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie25 juin 2025
Dimension du vecteur896
Représentationdense
Paramètres494 millions
Paramètres actifs494 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR51,7 %79ᵉ / 192mteb✅ Mesuré
MTEB: Chinese68,1 %24ᵉ / 58mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB placent le modèle dans la première moitié du classement en chinois et sur BEIR. Son profil est donc adapté à la recherche multilingue et au retrieval sans entraînement spécifique sur des domaines variés, sans toutefois figurer parmi les tout premiers. La fenêtre de 32k tokens facilite l’encodage de documents longs. La licence MIT autorise l’auto-hébergement et l’intégration commerciale. Les dimensions MRL de 896, 512, 256, 128 et 64 permettent aussi d’ajuster la taille des index et le coût de recherche.

Limites et points d'attention. Les classements sur Chinese et BEIR restent éloignés de la tête, ce qui signale une qualité correcte plutôt que dominante en recherche et en représentation du chinois. Les vecteurs complets de dimension 896 alourdissent davantage le stockage et les calculs de similarité que les variantes MRL réduites, avec un compromis possible sur la précision. Sorti depuis environ un an, le modèle est déjà ancien à l’échelle rapide de l’IA et peut être dépassé par des embeddings plus récents. Usages pertinents : RAG multilingue, recherche sémantique, reranking, similarité, classification et clustering de corpus, notamment lorsque l’auto-hébergement et les documents longs sont prioritaires.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).