HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1
Publié par HIT-TMG le 23 octobre 2024 sous licence ouverte MIT, HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1 est un modèle d’embedding multilingue dense de 494 millions de paramètres, tous actifs. Adapté de Qwen2-0.5B, il produit des vecteurs de 896 dimensions.
Publié par HIT-TMG le 23 octobre 2024 sous licence ouverte MIT, HIT-TMG/KaLM-embedding-multilingual-mini-instruct-v1 est un modèle d’embedding multilingue dense de 494 millions de paramètres, tous actifs. Adapté de Qwen2-0.5B, il produit des vecteurs de 896 dimensions.
Le modèle sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Entraîné par préentraînement faiblement supervisé puis ajustement supervisé, il encode les phrases avec Sentence Transformers et prend en charge la normalisation des représentations. Une instruction peut être ajoutée aux requêtes de classification et de clustering, tandis que le corpus reste sans instruction.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | HIT-TMG |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 23 octobre 2024 |
| Dimension du vecteur | 896 |
| Représentation | dense |
| Paramètres | 494 millions |
| Paramètres actifs | 494 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 51,9 % | 76ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: BEIR-NL | 26,1 % | 12ᵉ / 16 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 65,1 % | 26ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 46,0 % | 60ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 57,3 % | 28ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 54,5 % | 31ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 57,8 % | 29ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 29,1 % | 93ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 48,8 % | 57ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chinese | 63,0 % | 42ᵉ / 58 | mteb | ✅ Mesuré |
| MTEB: French | 61,8 % | 21ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Russian | 60,0 % | 26ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: BEIR-NL
Notre analyse
Forces. Les résultats MTEB placent le modèle dans une position solide sur Long-context Retrieval, ce qui indique une bonne aptitude à retrouver des passages pertinents dans des tâches synthétiques et réelles portant sur des contextes longs. Les évaluations French, European et Russian montrent une polyvalence multilingue utile pour la recherche, la classification, le clustering, le reranking et le rapprochement de textes. Le track Medical demeure également compétitif pour la recherche d’informations cliniques, biomédicales et destinées au grand public. La licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration dans des systèmes propriétaires.
Limites et points d’attention. Le track Chinese est le moins bien classé de ses évaluations linguistiques, avec une position proche du bas du classement, tandis que les résultats European et Russian restent davantage intermédiaires que dominants. Les vecteurs denses de 896 dimensions imposent un stockage et un calcul de recherche plus importants que des représentations de dimension inférieure. Avec environ deux ans d’ancienneté, une durée très longue à l’échelle de l’IA, cette génération est probablement dépassée par des modèles plus récents et peut ne plus figurer dans les catalogues actuels. Usages pertinents : RAG multilingue, recherche sémantique, clustering et indexation de contenus français, européens, russes ou médicaux.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).