ibm-granite/granite-embedding-107m-multilingual

Publié par IBM le 18 décembre 2024, ibm-granite/granite-embedding-107m-multilingual est un bi-encodeur dense de 107 millions de paramètres, fondé sur XLM-RoBERTa. Il transforme des séquences allant jusqu’à 512 tokens en vecteurs normalisés de 384 dimensions, obtenus par pooling CLS.

Publié par IBM le 18 décembre 2024, ibm-granite/granite-embedding-107m-multilingual est un bi-encodeur dense de 107 millions de paramètres, fondé sur XLM-RoBERTa. Il transforme des séquences allant jusqu’à 512 tokens en vecteurs normalisés de 384 dimensions, obtenus par pooling CLS.

Le modèle couvre 12 langues, dont le français, l’anglais, l’allemand, le coréen, l’arabe, le japonais et le chinois. Sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré avec Sentence Transformers ou Hugging Face Transformers pour la recherche sémantique, la récupération de passages en RAG, la mesure de similarité et le clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurIBM
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie18 décembre 2024
Dimension du vecteur384
Représentationdense
Paramètres107 millions
Paramètres actifs107 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR45,3 %123ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval34,3 %106ᵉ / 170mteb✅ Mesuré
MTEB: Code Information Retrieval36,7 %46ᵉ / 49mteb✅ Mesuré
MTEB: Code40,7 %40ᵉ / 43mteb✅ Mesuré
MTEB: RTEB Legal32,7 %118ᵉ / 208mteb✅ Mesuré
MTEB: Medical46,8 %49ᵉ / 158mteb✅ Mesuré
MTEB: Legal41,8 %63ᵉ / 157mteb✅ Mesuré
MTEB: European52,5 %44ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French37,4 %78ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German32,8 %92ᵉ / 209mteb✅ Mesuré
MTEB: Korean62,4 %20ᵉ / 102mteb✅ Mesuré
MTEB: Indic56,8 %38ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB montrent un positionnement multilingue relativement équilibré, avec ses rangs les plus favorables sur les évaluations Korean et German. Les tracks couvrent notamment la recherche, le reranking, la classification, le clustering, l’appariement de textes et le bitext mining, ce qui correspond à des usages variés d’indexation et de rapprochement sémantique. La dimension compacte de 384 réduit l’espace occupé par les index et le coût des comparaisons par rapport à des représentations plus larges. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration commerciale.

Limites et points d'attention. Les classements MTEB sont moins favorables sur les ensembles European, Russian, Indic et French, où le modèle se situe plutôt dans le milieu du tableau. La limite de 512 tokens impose de segmenter les documents longs avant indexation. Sorti fin 2024, il affiche une ancienneté très importante à l’échelle de l’IA et doit être comparé aux modèles multilingues plus récents, susceptibles de l’avoir dépassé ou remplacé dans les catalogues. Usages pertinents : recherche sémantique multilingue, RAG sur passages courts, déduplication, similarité et clustering avec un index compact.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).