KaLM-Embedding/KaLM-embedding-multilingual-mini-instruct-v2.5

KaLM-Embedding/KaLM-embedding-multilingual-mini-instruct-v2.5 est un modèle d’embedding multilingue de KaLM-Embedding, publié sous licence ouverte Apache 2.0. Fondé sur Qwen2, il compte 494 millions de paramètres, utilise une attention bidirectionnelle avec mean pooling et accepte…

KaLM-Embedding/KaLM-embedding-multilingual-mini-instruct-v2.5 est un modèle d’embedding multilingue de KaLM-Embedding, publié sous licence ouverte Apache 2.0. Fondé sur Qwen2, il compte 494 millions de paramètres, utilise une attention bidirectionnelle avec mean pooling et accepte jusqu’à 32k tokens.

Il transforme les textes en vecteurs denses de 896 dimensions pour la recherche sémantique, le RAG, la similarité et le clustering. Ses embeddings Matryoshka peuvent aussi être ramenés à 512, 256, 128 ou 64 dimensions. Des instructions de tâche et des interfaces distinctes permettent d’encoder requêtes et documents.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurKaLM-Embedding
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie30 septembre 2025
Dimension du vecteur896
Représentationdense, avec embeddings Matryoshka à dimensions variables
Paramètres494 millions
Paramètres actifs494 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR55,0 %43ᵉ / 192mteb✅ Mesuré
MTEB: Chinese70,9 %16ᵉ / 58mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ KaLM-Embedding/KaLM-emb…55 %
WhereIsAI/UAE-Large-V155 %

MTEB: Chinese

▶ KaLM-Embedding/KaLM-emb…71 %
sensenova/piccolo-large…71 %

Notre analyse

Forces. Les résultats MTEB indiquent une qualité solide sur les textes chinois et la recherche multilingue, sans placer le modèle tout en tête du classement Chinese. Sur BEIR, il se situe dans le quart supérieur pour la recherche zero-shot à travers des tâches et domaines hétérogènes. La longueur maximale annoncée de 32k tokens facilite l’encodage de documents longs. Les dimensions Matryoshka permettent d’ajuster la taille des vecteurs aux contraintes de stockage et de latence, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d’attention. Malgré ses résultats favorables, son classement Chinese reste derrière plusieurs modèles concurrents, et BEIR ne le situe pas parmi les toutes premières références. Les vecteurs complets de 896 dimensions alourdissent les index et augmentent le coût de la recherche par rapport aux variantes réduites, lesquelles impliquent un arbitrage sur la richesse de la représentation. La limite de 32k tokens demeure une longueur maximale annoncée et impose un découpage aux contenus qui la dépassent. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, rapprochement de textes, classification et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).