ibm-granite/granite-embedding-30m-english
Publié par IBM le 18 décembre 2024, ibm-granite/granite-embedding-30m-english est un modèle d’embedding anglophone sous licence ouverte Apache 2.0. Ce bi-encodeur dense de 30 millions de paramètres repose sur un transformeur RoBERTa à encodeur seul et produit, par pooling CLS, des…
Publié par IBM le 18 décembre 2024, ibm-granite/granite-embedding-30m-english est un modèle d’embedding anglophone sous licence ouverte Apache 2.0. Ce bi-encodeur dense de 30 millions de paramètres repose sur un transformeur RoBERTa à encodeur seul et produit, par pooling CLS, des vecteurs de 384 dimensions.
Le modèle convertit des textes anglais en représentations de longueur fixe destinées à la recherche sémantique, au RAG, à la similarité et au clustering. Sa révision r1.1 traite aussi la récupération contextuelle dans des conversations à plusieurs tours présentées en ordre chronologique inverse.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | IBM |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 18 décembre 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 30 millions |
| Paramètres actifs | 30 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 49,1 % | 108ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 38,4 % | 85ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 46,9 % | 41ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 50,3 % | 36ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 27,0 % | 163ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 37,3 % | 93ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 35,7 % | 110ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 44,7 % | 97ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 14,6 % | 149ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 10,8 % | 172ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 45,3 % | 85ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Dutch | 37,5 % | 81ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Son meilleur positionnement relatif concerne la recherche d’information généraliste évaluée par BEIR, qui couvre des tâches et domaines hétérogènes en zero-shot, même si son classement reste éloigné des premières places. Ses 384 dimensions constituent un format compact, favorable à des index vectoriels plus légers et à une recherche moins coûteuse que des représentations plus larges. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. La prise en charge des conversations à plusieurs tours apporte aussi un intérêt pour la récupération contextuelle.
Limites et points d’attention. Le modèle est spécialisé dans l’anglais. Ses résultats sur les tracks French et European se situent dans la partie basse des classements, ce qui limite son intérêt pour des corpus multilingues. Long-context Retrieval reste également modeste, sans avantage marqué pour la récupération dans des contenus longs. Sorti en décembre 2024 et considéré comme très ancien à l’échelle de l’IA après environ deux ans, il est probablement dépassé par des embeddings plus récents et peut avoir quitté certains catalogues. Usages pertinents : petits index anglophones, recherche sémantique généraliste, RAG compact, similarité et clustering sous licence ouverte.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).