ibm-granite/granite-embedding-278m-multilingual

Publié par IBM le 18 décembre 2024, ibm-granite/granite-embedding-278m-multilingual est un modèle d’embedding multilingue de 278 millions de paramètres. Son architecture de type XLM-RoBERTa, fondée sur un Transformer encodeur seul, produit des vecteurs de longueur fixe à 768 dimensions.

Publié par IBM le 18 décembre 2024, ibm-granite/granite-embedding-278m-multilingual est un modèle d’embedding multilingue de 278 millions de paramètres. Son architecture de type XLM-RoBERTa, fondée sur un Transformer encodeur seul, produit des vecteurs de longueur fixe à 768 dimensions.

Le modèle sert à indexer et comparer des textes pour la recherche sémantique, le retrieval d’un système RAG, la mesure de similarité et le clustering. Il couvre notamment le français, l’anglais, l’allemand, le coréen, l’arabe, le japonais et le chinois. Sa licence ouverte Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurIBM
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie18 décembre 2024
Dimension du vecteur768
Représentationvecteurs d'embedding de longueur fixe de taille 768
Paramètres278 millions
Paramètres actifs278 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR48,2 %114ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval37,7 %87ᵉ / 170mteb✅ Mesuré
MTEB: Code Information Retrieval45,4 %42ᵉ / 49mteb✅ Mesuré
MTEB: Code48,4 %37ᵉ / 43mteb✅ Mesuré
MTEB: RTEB Legal35,4 %93ᵉ / 208mteb✅ Mesuré
MTEB: Medical50,9 %43ᵉ / 158mteb✅ Mesuré
MTEB: Legal45,8 %51ᵉ / 157mteb✅ Mesuré
MTEB: European54,6 %38ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French40,8 %72ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German36,8 %87ᵉ / 209mteb✅ Mesuré
MTEB: Korean63,6 %18ᵉ / 102mteb✅ Mesuré
MTEB: Indic60,0 %26ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB placent le modèle le plus favorablement sur le coréen et l’allemand, avec des positions également solides sur les langues indiciennes. Ces évaluations couvrent plusieurs usages des embeddings, notamment la classification, la recherche, le reranking, le clustering et la mise en correspondance de textes. La prise en charge de douze langues facilite la constitution d’index multilingues avec un même encodeur. La compatibilité avec Sentence Transformers et Hugging Face Transformers simplifie son intégration. Le pooling CLS suivi d’une normalisation fournit des représentations directement exploitables pour la similarité, tandis que la licence Apache 2.0 facilite le déploiement autonome.

Limites et points d’attention. Les classements MTEB sont moins favorables sur les ensembles European et Russian, tandis que le français se situe derrière les meilleurs modèles évalués. Les vecteurs à 768 dimensions imposent un compromis entre richesse de représentation, taille des index et coût de la recherche à grande échelle. Son ancienneté d’environ deux ans est très longue dans ce domaine, ce qui rend le modèle probablement dépassé par des embeddings multilingues plus récents et susceptible d’avoir quitté certains catalogues. Usages pertinents : recherche sémantique multilingue, retrieval pour RAG, déduplication, similarité et clustering de corpus dans les langues prises en charge.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).