ibm-granite/granite-embedding-107m-multilingual
Publié par IBM le 18 décembre 2024, ibm-granite/granite-embedding-107m-multilingual est un bi-encodeur dense de 107 millions de paramètres, fondé sur XLM-RoBERTa. Il transforme des séquences allant jusqu’à 512 tokens en vecteurs normalisés de 384 dimensions, obtenus par pooling CLS.
Publié par IBM le 18 décembre 2024, ibm-granite/granite-embedding-107m-multilingual est un bi-encodeur dense de 107 millions de paramètres, fondé sur XLM-RoBERTa. Il transforme des séquences allant jusqu’à 512 tokens en vecteurs normalisés de 384 dimensions, obtenus par pooling CLS.
Le modèle couvre 12 langues, dont le français, l’anglais, l’allemand, le coréen, l’arabe, le japonais et le chinois. Sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré avec Sentence Transformers ou Hugging Face Transformers pour la recherche sémantique, la récupération de passages en RAG, la mesure de similarité et le clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | IBM |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 18 décembre 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 107 millions |
| Paramètres actifs | 107 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 45,3 % | 123ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 34,3 % | 106ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 36,7 % | 46ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 40,7 % | 40ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 32,7 % | 118ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 46,8 % | 49ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 41,8 % | 63ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 52,5 % | 44ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 37,4 % | 78ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 32,8 % | 92ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Korean | 62,4 % | 20ᵉ / 102 | mteb | ✅ Mesuré |
| MTEB: Indic | 56,8 % | 38ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB montrent un positionnement multilingue relativement équilibré, avec ses rangs les plus favorables sur les évaluations Korean et German. Les tracks couvrent notamment la recherche, le reranking, la classification, le clustering, l’appariement de textes et le bitext mining, ce qui correspond à des usages variés d’indexation et de rapprochement sémantique. La dimension compacte de 384 réduit l’espace occupé par les index et le coût des comparaisons par rapport à des représentations plus larges. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration commerciale.
Limites et points d'attention. Les classements MTEB sont moins favorables sur les ensembles European, Russian, Indic et French, où le modèle se situe plutôt dans le milieu du tableau. La limite de 512 tokens impose de segmenter les documents longs avant indexation. Sorti fin 2024, il affiche une ancienneté très importante à l’échelle de l’IA et doit être comparé aux modèles multilingues plus récents, susceptibles de l’avoir dépassé ou remplacé dans les catalogues. Usages pertinents : recherche sémantique multilingue, RAG sur passages courts, déduplication, similarité et clustering avec un index compact.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).