ibm-granite/granite-embedding-97m-multilingual-r2
ibm-granite/granite-embedding-97m-multilingual-r2 est un modèle d’embedding dense bi-encodeur de 97 millions de paramètres publié par IBM sous licence ouverte Apache 2.0. Fondé sur ModernBERT, il transforme les textes en vecteurs de 384 dimensions et accepte des séquences allant jusqu’à…
ibm-granite/granite-embedding-97m-multilingual-r2 est un modèle d’embedding dense bi-encodeur de 97 millions de paramètres publié par IBM sous licence ouverte Apache 2.0. Fondé sur ModernBERT, il transforme les textes en vecteurs de 384 dimensions et accepte des séquences allant jusqu’à 32 768 tokens.
Sa couverture dépasse 200 langues, avec un entraînement renforcé pour 52 d’entre elles. Il sert à indexer des documents pour la recherche sémantique et le RAG, à mesurer la similarité entre textes et à constituer des groupes thématiques par clustering. Des versions ONNX et OpenVINO facilitent son déploiement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | IBM |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 29 avril 2026 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 97 millions |
| Paramètres actifs | 97 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 47,3 % | 118ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 65,5 % | 25ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 10,5 % | 23ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 58,7 % | 34ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 60,4 % | 29ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 38,4 % | 84ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 41,2 % | 67ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 48,1 % | 73ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 31,5 % | 88ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 34,3 % | 89ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Dutch | 51,4 % | 39ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le résultat le plus convaincant apparaît sur MTEB Long-context Retrieval, où le modèle se place dans le groupe de tête. Sa longue fenêtre de contexte favorise l’indexation et la récupération d’information dans des documents étendus. Les résultats en néerlandais indiquent également une aptitude multilingue solide, cohérente avec sa couverture linguistique et son entraînement renforcé pour 52 langues. Les vecteurs denses de 384 dimensions permettent de limiter la taille des index et les besoins de stockage. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. La compatibilité avec Sentence Transformers, vLLM, ONNX, OpenVINO et llama.cpp après conversion GGUF élargit les options de déploiement.
Limites et points d’attention. Les résultats sur BEIR se situent dans la moitié basse du classement, ce qui signale une robustesse plus limitée sur des tâches de recherche hétérogènes et évaluées sans adaptation préalable. RTEB Finance est également moins favorable, avec un positionnement dans le dernier quart, ce qui invite à valider le modèle sur des corpus financiers représentatifs avant déploiement. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, rapprochement de textes et clustering avec des index compacts.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).