ibm-granite/granite-embedding-30m-english

Publié par IBM le 18 décembre 2024, ibm-granite/granite-embedding-30m-english est un modèle d’embedding anglophone sous licence ouverte Apache 2.0. Ce bi-encodeur dense de 30 millions de paramètres repose sur un transformeur RoBERTa à encodeur seul et produit, par pooling CLS, des…

Publié par IBM le 18 décembre 2024, ibm-granite/granite-embedding-30m-english est un modèle d’embedding anglophone sous licence ouverte Apache 2.0. Ce bi-encodeur dense de 30 millions de paramètres repose sur un transformeur RoBERTa à encodeur seul et produit, par pooling CLS, des vecteurs de 384 dimensions.

Le modèle convertit des textes anglais en représentations de longueur fixe destinées à la recherche sémantique, au RAG, à la similarité et au clustering. Sa révision r1.1 traite aussi la récupération contextuelle dans des conversations à plusieurs tours présentées en ordre chronologique inverse.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurIBM
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie18 décembre 2024
Dimension du vecteur384
Représentationdense
Paramètres30 millions
Paramètres actifs30 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR49,1 %108ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval38,4 %85ᵉ / 170mteb✅ Mesuré
MTEB: Code Information Retrieval46,9 %41ᵉ / 49mteb✅ Mesuré
MTEB: Code50,3 %36ᵉ / 43mteb✅ Mesuré
MTEB: RTEB Legal27,0 %163ᵉ / 208mteb✅ Mesuré
MTEB: Medical37,3 %93ᵉ / 158mteb✅ Mesuré
MTEB: Legal35,7 %110ᵉ / 157mteb✅ Mesuré
MTEB: European44,7 %97ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French14,6 %149ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German10,8 %172ᵉ / 209mteb✅ Mesuré
MTEB: French45,3 %85ᵉ / 117mteb✅ Mesuré
MTEB: Dutch37,5 %81ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Son meilleur positionnement relatif concerne la recherche d’information généraliste évaluée par BEIR, qui couvre des tâches et domaines hétérogènes en zero-shot, même si son classement reste éloigné des premières places. Ses 384 dimensions constituent un format compact, favorable à des index vectoriels plus légers et à une recherche moins coûteuse que des représentations plus larges. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. La prise en charge des conversations à plusieurs tours apporte aussi un intérêt pour la récupération contextuelle.

Limites et points d’attention. Le modèle est spécialisé dans l’anglais. Ses résultats sur les tracks French et European se situent dans la partie basse des classements, ce qui limite son intérêt pour des corpus multilingues. Long-context Retrieval reste également modeste, sans avantage marqué pour la récupération dans des contenus longs. Sorti en décembre 2024 et considéré comme très ancien à l’échelle de l’IA après environ deux ans, il est probablement dépassé par des embeddings plus récents et peut avoir quitté certains catalogues. Usages pertinents : petits index anglophones, recherche sémantique généraliste, RAG compact, similarité et clustering sous licence ouverte.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).