jinaai/jina-embeddings-v2-base-en

Publié par Jina AI le 27 septembre 2023, jinaai/jina-embeddings-v2-base-en est un modèle d’embedding anglophone de 137 millions de paramètres. Fondé sur l’architecture JinaBERT avec une variante bidirectionnelle symétrique d’ALiBi, il accepte jusqu’à 8 192 tokens et produit des vecteurs…

Publié par Jina AI le 27 septembre 2023, jinaai/jina-embeddings-v2-base-en est un modèle d’embedding anglophone de 137 millions de paramètres. Fondé sur l’architecture JinaBERT avec une variante bidirectionnelle symétrique d’ALiBi, il accepte jusqu’à 8 192 tokens et produit des vecteurs denses de 768 dimensions.

Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé. Ses embeddings de phrases ou de paragraphes servent à la recherche sémantique, au RAG, à la mesure de similarité, au clustering, au reranking et à la recommandation, notamment sur des documents longs.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurJina AI
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie27 septembre 2023
Dimension du vecteur768
Représentationdense
Paramètres137 millions
Paramètres actifs137 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR45,3 %125ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval1,8 %170ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal4,5 %207ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare27,3 %79ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance52,4 %66ᵉ / 97mteb✅ Mesuré
MTEB: Medical21,1 %139ᵉ / 158mteb✅ Mesuré
MTEB: Legal3,2 %157ᵉ / 157mteb✅ Mesuré
MTEB: European27,2 %127ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French0,1 %217ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German2,6 %207ᵉ / 209mteb✅ Mesuré
MTEB: Indic28,9 %118ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ jinaai/jina-embeddings-…45 %

MTEB: Long-context Retrieval

malenia1/ternary-weight…6 %
▶ jinaai/jina-embeddings-…2 %

Notre analyse

Forces. Ses résultats MTEB les plus favorables concernent RTEB Finance et BEIR, ce qui en fait surtout un modèle de recherche d’information en anglais, avec un intérêt relatif pour les contenus financiers et la recherche zero-shot sur des domaines hétérogènes. La fenêtre de 8 192 tokens facilite l’indexation de longs paragraphes ou documents. Les vecteurs de 768 dimensions offrent un format relativement contenu pour le stockage et l’interrogation d’un index. La licence Apache 2.0 autorise par ailleurs l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d'attention. Les classements MTEB sont faibles sur Indic et European, presque en queue de classement, ce qui concorde avec son positionnement monolingue anglais. Les résultats sont également modestes sur Medical et RTEB Healthcare, tandis que BEIR et RTEB Finance ne le placent pas parmi les références de tête. Sorti en 2023, il appartient à une génération désormais ancienne à l’échelle de l’IA et probablement dépassée par des modèles plus récents. Usages pertinents : recherche sémantique, RAG, similarité et clustering de contenus anglais, en particulier lorsque les longues séquences et l’auto-hébergement sont prioritaires.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).