jinaai/jina-embedding-b-en-v1
Publié par Jina AI le 7 juillet 2023, jinaai/jina-embedding-b-en-v1 est un modèle d’embedding anglophone de 110 millions de paramètres. Il produit des représentations denses de 768 dimensions et est distribué sous licence ouverte Apache 2.0.
Publié par Jina AI le 7 juillet 2023, jinaai/jina-embedding-b-en-v1 est un modèle d’embedding anglophone de 110 millions de paramètres. Il produit des représentations denses de 768 dimensions et est distribué sous licence ouverte Apache 2.0.
Le modèle transforme les textes en vecteurs destinés à la recherche sémantique, au RAG, à la similarité et au clustering. Son entraînement repose sur Linnaeus-Clean, un ensemble de 380 millions de paires de phrases issues de domaines variés, notamment des paires requête-document. Il s’utilise aussi pour le reranking avec Jina AI Finetuner ou sentence-transformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Jina AI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 7 juillet 2023 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 110 millions |
| Paramètres actifs | 110 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 44,0 % | 130ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 37,2 % | 90ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 34,4 % | 102ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 33,1 % | 105ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 40,8 % | 72ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 45,7 % | 91ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 26,9 % | 106ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 29,9 % | 96ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Dutch | 36,3 % | 87ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Korean | 6,6 % | 86ᵉ / 102 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Ses résultats MTEB les plus élevés concernent European et BEIR, ce qui indique une aptitude relative à représenter des textes européens et à effectuer de la recherche zero-shot sur des tâches et domaines hétérogènes. Le modèle obtient également un résultat intermédiaire sur Legal, couvrant notamment les décisions, les textes législatifs et les questions-réponses juridiques. Sa licence Apache 2.0 autorise l’auto-hébergement et l’adaptation, tandis que ses 110 millions de paramètres facilitent un déploiement moins lourd que celui de modèles d’embedding beaucoup plus volumineux.
Limites et points d’attention. Les classements MTEB placent globalement le modèle dans la seconde moitié des modèles évalués, y compris sur European, BEIR et Legal. Les résultats sont plus faibles sur Dutch, Long-context Retrieval et RTEB Legal, ce qui réduit son intérêt pour le néerlandais, les documents longs et la recherche juridique spécialisée. Sa conception anglophone limite aussi la portée multilingue suggérée par certaines évaluations européennes. Sorti en 2023, il est ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents et souvent retiré des catalogues actuels. Usages pertinents : recherche sémantique anglophone, RAG simple, similarité, clustering et reranking dans un environnement auto-hébergé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).