ibm-granite/granite-embedding-english-r2

Publié par IBM le 15 août 2025 sous licence ouverte Apache 2.0, ibm-granite/granite-embedding-english-r2 est un modèle dense bi-encodeur anglophone fondé sur ModernBERT. Ses 149 millions de paramètres produisent des vecteurs de 768 dimensions à partir de séquences pouvant atteindre 8 192…

Publié par IBM le 15 août 2025 sous licence ouverte Apache 2.0, ibm-granite/granite-embedding-english-r2 est un modèle dense bi-encodeur anglophone fondé sur ModernBERT. Ses 149 millions de paramètres produisent des vecteurs de 768 dimensions à partir de séquences pouvant atteindre 8 192 jetons.

Le modèle transforme requêtes, passages et documents en représentations de longueur fixe, comparables par similarité cosinus. Il sert à la recherche sémantique, à la récupération de contenus pour le RAG, à la mesure de similarité et au clustering, sans générer de texte. Son entraînement associe préentraînement orienté récupération, affinage contrastif, distillation de connaissances et fusion de modèles.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurIBM
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie15 août 2025
Dimension du vecteur768
Représentationdense
Paramètres149 millions
Paramètres actifs149 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR53,1 %63ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval65,6 %24ᵉ / 170mteb✅ Mesuré
MTEB: Code Information Retrieval54,6 %35ᵉ / 49mteb✅ Mesuré
MTEB: Code57,2 %31ᵉ / 43mteb✅ Mesuré
MTEB: RTEB Legal35,2 %97ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare44,1 %62ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance58,2 %50ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French22,4 %122ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German23,6 %111ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le résultat le plus favorable apparaît sur MTEB Long-context Retrieval, où le modèle se situe dans le groupe de tête. Sa fenêtre de 8 192 jetons constitue un atout pour indexer des passages étendus et rechercher dans des documents longs. Les résultats sur BEIR indiquent également une capacité solide de récupération zero-shot dans des tâches et domaines hétérogènes. Le tokenizer optimisé pour les données textuelles et le code élargit la nature des contenus indexables, même si le modèle reste centré sur l’anglais. La licence Apache 2.0 autorise l’auto-hébergement, l’adaptation et l’intégration dans des systèmes propriétaires ou ouverts.

Limites et points d'attention. Les résultats sont moins convaincants dans les évaluations spécialisées. RTEB Finance le place autour du milieu du classement, tandis que RTEB Healthcare se situe dans la partie basse, ce qui invite à valider la qualité sur les corpus métier concernés. Son orientation anglophone limite son intérêt pour des collections multilingues. Les vecteurs denses de 768 dimensions imposent aussi un coût de stockage et de calcul de similarité supérieur à celui de représentations plus courtes, particulièrement à grande échelle. Usages pertinents : recherche sémantique en anglais, RAG sur documents longs, déduplication, similarité textuelle et clustering de corpus.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).