ibm-granite/granite-embedding-english-r2
Publié par IBM le 15 août 2025 sous licence ouverte Apache 2.0, ibm-granite/granite-embedding-english-r2 est un modèle dense bi-encodeur anglophone fondé sur ModernBERT. Ses 149 millions de paramètres produisent des vecteurs de 768 dimensions à partir de séquences pouvant atteindre 8 192…
Publié par IBM le 15 août 2025 sous licence ouverte Apache 2.0, ibm-granite/granite-embedding-english-r2 est un modèle dense bi-encodeur anglophone fondé sur ModernBERT. Ses 149 millions de paramètres produisent des vecteurs de 768 dimensions à partir de séquences pouvant atteindre 8 192 jetons.
Le modèle transforme requêtes, passages et documents en représentations de longueur fixe, comparables par similarité cosinus. Il sert à la recherche sémantique, à la récupération de contenus pour le RAG, à la mesure de similarité et au clustering, sans générer de texte. Son entraînement associe préentraînement orienté récupération, affinage contrastif, distillation de connaissances et fusion de modèles.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | IBM |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 15 août 2025 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 149 millions |
| Paramètres actifs | 149 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 53,1 % | 63ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 65,6 % | 24ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 54,6 % | 35ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 57,2 % | 31ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 35,2 % | 97ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 44,1 % | 62ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 58,2 % | 50ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 22,4 % | 122ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 23,6 % | 111ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le résultat le plus favorable apparaît sur MTEB Long-context Retrieval, où le modèle se situe dans le groupe de tête. Sa fenêtre de 8 192 jetons constitue un atout pour indexer des passages étendus et rechercher dans des documents longs. Les résultats sur BEIR indiquent également une capacité solide de récupération zero-shot dans des tâches et domaines hétérogènes. Le tokenizer optimisé pour les données textuelles et le code élargit la nature des contenus indexables, même si le modèle reste centré sur l’anglais. La licence Apache 2.0 autorise l’auto-hébergement, l’adaptation et l’intégration dans des systèmes propriétaires ou ouverts.
Limites et points d'attention. Les résultats sont moins convaincants dans les évaluations spécialisées. RTEB Finance le place autour du milieu du classement, tandis que RTEB Healthcare se situe dans la partie basse, ce qui invite à valider la qualité sur les corpus métier concernés. Son orientation anglophone limite son intérêt pour des collections multilingues. Les vecteurs denses de 768 dimensions imposent aussi un coût de stockage et de calcul de similarité supérieur à celui de représentations plus courtes, particulièrement à grande échelle. Usages pertinents : recherche sémantique en anglais, RAG sur documents longs, déduplication, similarité textuelle et clustering de corpus.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).