ibm-granite/granite-embedding-311m-multilingual-r2
ibm-granite/granite-embedding-311m-multilingual-r2 est un modèle d’embedding dense d’IBM, publié le 29 avril 2026 sous licence ouverte Apache 2.0. Fondé sur ModernBERT, il compte 312 millions de paramètres et produit par défaut des vecteurs de 768 dimensions par pooling CLS.
ibm-granite/granite-embedding-311m-multilingual-r2 est un modèle d’embedding dense d’IBM, publié le 29 avril 2026 sous licence ouverte Apache 2.0. Fondé sur ModernBERT, il compte 312 millions de paramètres et produit par défaut des vecteurs de 768 dimensions par pooling CLS.
Sa fenêtre atteint 32 768 tokens et sa couverture dépasse 200 langues, avec un entraînement interlingue explicite dans 52 langues. Il encode requêtes, passages et documents afin d’en comparer la proximité par similarité cosinus, notamment pour la recherche sémantique, le RAG et le clustering. Ses dimensions Matryoshka peuvent être réduites à 512, 384, 256 ou 128.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | IBM |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 29 avril 2026 |
| Dimension du vecteur | 768 |
| Représentation | dense, avec dimensions Matryoshka tronquables |
| Paramètres | 312 millions |
| Paramètres actifs | 312 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 49,3 % | 106ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 71,7 % | 15ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 11,7 % | 21ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 62,3 % | 31ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 63,8 % | 26ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 40,2 % | 78ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 46,9 % | 56ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 52,9 % | 64ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 36,6 % | 79ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 37,8 % | 86ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Dutch | 54,1 % | 31ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le résultat le plus convaincant apparaît sur MTEB Long-context Retrieval, où le modèle se classe parmi les mieux placés. Cette aptitude, associée à une séquence maximale de 32 768 tokens, favorise l’indexation et la recherche dans des documents longs. La prise en charge de plus de 200 langues et l’entraînement au transfert interlingue en font aussi un candidat adapté aux corpus multilingues. Les représentations Matryoshka permettent de réduire la dimension des vecteurs afin d’alléger les index et les calculs de similarité. La licence Apache 2.0 facilite par ailleurs l’auto-hébergement et l’intégration dans des systèmes ouverts.
Limites et points d’attention. Les résultats sont moins distinctifs sur Dutch, où le modèle reste derrière les premières places, ainsi que sur RTEB Finance. Son positionnement sur BEIR est également plus moyen, ce qui indique une efficacité moins régulière en recherche zero-shot sur des tâches et domaines hétérogènes. Les vecteurs de 768 dimensions exigent davantage de stockage et de calcul que leurs versions tronquées, tandis que la réduction à 512, 384, 256 ou 128 dimensions constitue un arbitrage entre compacité et richesse de représentation. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, similarité textuelle et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).