KaLM-Embedding/KaLM-embedding-multilingual-mini-instruct-v2.5
KaLM-Embedding/KaLM-embedding-multilingual-mini-instruct-v2.5 est un modèle d’embedding multilingue de KaLM-Embedding, publié sous licence ouverte Apache 2.0. Fondé sur Qwen2, il compte 494 millions de paramètres, utilise une attention bidirectionnelle avec mean pooling et accepte…
KaLM-Embedding/KaLM-embedding-multilingual-mini-instruct-v2.5 est un modèle d’embedding multilingue de KaLM-Embedding, publié sous licence ouverte Apache 2.0. Fondé sur Qwen2, il compte 494 millions de paramètres, utilise une attention bidirectionnelle avec mean pooling et accepte jusqu’à 32k tokens.
Il transforme les textes en vecteurs denses de 896 dimensions pour la recherche sémantique, le RAG, la similarité et le clustering. Ses embeddings Matryoshka peuvent aussi être ramenés à 512, 256, 128 ou 64 dimensions. Des instructions de tâche et des interfaces distinctes permettent d’encoder requêtes et documents.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | KaLM-Embedding |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 30 septembre 2025 |
| Dimension du vecteur | 896 |
| Représentation | dense, avec embeddings Matryoshka à dimensions variables |
| Paramètres | 494 millions |
| Paramètres actifs | 494 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 55,0 % | 43ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Chinese | 70,9 % | 16ᵉ / 58 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Chinese
Notre analyse
Forces. Les résultats MTEB indiquent une qualité solide sur les textes chinois et la recherche multilingue, sans placer le modèle tout en tête du classement Chinese. Sur BEIR, il se situe dans le quart supérieur pour la recherche zero-shot à travers des tâches et domaines hétérogènes. La longueur maximale annoncée de 32k tokens facilite l’encodage de documents longs. Les dimensions Matryoshka permettent d’ajuster la taille des vecteurs aux contraintes de stockage et de latence, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d’attention. Malgré ses résultats favorables, son classement Chinese reste derrière plusieurs modèles concurrents, et BEIR ne le situe pas parmi les toutes premières références. Les vecteurs complets de 896 dimensions alourdissent les index et augmentent le coût de la recherche par rapport aux variantes réduites, lesquelles impliquent un arbitrage sur la richesse de la représentation. La limite de 32k tokens demeure une longueur maximale annoncée et impose un découpage aux contenus qui la dépassent. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, rapprochement de textes, classification et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).