HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v2
Publié par HIT-TMG le 25 juin 2025 sous licence ouverte MIT, KaLM-embedding-multilingual-mini-instruct-v2 est un modèle d’embedding multilingue dense de 494 millions de paramètres, dérivé de Qwen2-0.5B avec une attention bidirectionnelle. Il accepte jusqu’à 32k tokens et produit par…
Publié par HIT-TMG le 25 juin 2025 sous licence ouverte MIT, KaLM-embedding-multilingual-mini-instruct-v2 est un modèle d’embedding multilingue dense de 494 millions de paramètres, dérivé de Qwen2-0.5B avec une attention bidirectionnelle. Il accepte jusqu’à 32k tokens et produit par défaut des vecteurs de dimension 896.
Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, au reranking, à la classification, à la similarité et au clustering. Des instructions adaptées aux tâches peuvent orienter l’encodage. Il fonctionne avec sentence-transformers et vLLM.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | HIT-TMG |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 25 juin 2025 |
| Dimension du vecteur | 896 |
| Représentation | dense |
| Paramètres | 494 millions |
| Paramètres actifs | 494 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 51,7 % | 79ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Chinese | 68,1 % | 24ᵉ / 58 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Chinese
Notre analyse
Forces. Les résultats MTEB placent le modèle dans la première moitié du classement en chinois et sur BEIR. Son profil est donc adapté à la recherche multilingue et au retrieval sans entraînement spécifique sur des domaines variés, sans toutefois figurer parmi les tout premiers. La fenêtre de 32k tokens facilite l’encodage de documents longs. La licence MIT autorise l’auto-hébergement et l’intégration commerciale. Les dimensions MRL de 896, 512, 256, 128 et 64 permettent aussi d’ajuster la taille des index et le coût de recherche.
Limites et points d'attention. Les classements sur Chinese et BEIR restent éloignés de la tête, ce qui signale une qualité correcte plutôt que dominante en recherche et en représentation du chinois. Les vecteurs complets de dimension 896 alourdissent davantage le stockage et les calculs de similarité que les variantes MRL réduites, avec un compromis possible sur la précision. Sorti depuis environ un an, le modèle est déjà ancien à l’échelle rapide de l’IA et peut être dépassé par des embeddings plus récents. Usages pertinents : RAG multilingue, recherche sémantique, reranking, similarité, classification et clustering de corpus, notamment lorsque l’auto-hébergement et les documents longs sont prioritaires.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).