jinaai/jina-embeddings-v2-small-en

Publié par Jina AI le 27 septembre 2023, jinaai/jina-embeddings-v2-small-en est un modèle d’embedding anglophone de 33 millions de paramètres, fondé sur l’architecture JinaBERT. Il produit des représentations denses de 512 dimensions et accepte des séquences allant jusqu’à 8192 tokens.

Publié par Jina AI le 27 septembre 2023, jinaai/jina-embeddings-v2-small-en est un modèle d’embedding anglophone de 33 millions de paramètres, fondé sur l’architecture JinaBERT. Il produit des représentations denses de 512 dimensions et accepte des séquences allant jusqu’à 8192 tokens.

Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé. Ses vecteurs de phrase ou de paragraphe, obtenus par pooling moyen, servent à la recherche sémantique, au RAG, à la similarité textuelle, au clustering, au reranking et à la recommandation, notamment dans des documents longs.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurJina AI
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie27 septembre 2023
Dimension du vecteur512
Représentationdense
Paramètres33 millions
Paramètres actifs33 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR45,1 %126ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval5,5 %168ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal21,6 %186ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare32,5 %75ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance45,8 %76ᵉ / 97mteb✅ Mesuré
MTEB: Medical21,0 %140ᵉ / 158mteb✅ Mesuré
MTEB: Legal16,0 %148ᵉ / 157mteb✅ Mesuré
MTEB: European33,4 %122ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French8,3 %162ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German2,9 %205ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ jinaai/jina-embeddings-…45 %

MTEB: Long-context Retrieval

malenia1/ternary-weight…6 %
▶ jinaai/jina-embeddings-…5 %

Notre analyse

Forces. Ses résultats MTEB les plus solides concernent RTEB Finance et BEIR, ce qui en fait surtout un modèle orienté vers la recherche d’information, y compris sur des corpus financiers et des domaines hétérogènes. La fenêtre de 8192 tokens facilite l’encodage de paragraphes et de documents longs. Les vecteurs de 512 dimensions limitent la taille des index par rapport à des représentations plus larges, tandis que les 33 millions de paramètres favorisent un déploiement relativement compact. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d'attention. Les classements MTEB restent modestes, y compris sur ses meilleurs tracks. Les performances sont particulièrement faibles sur European, RTEB Healthcare, RTEB Legal et Medical, avec des positions proches du bas des classements, ce qui limite son intérêt pour les langues européennes autres que l’anglais ainsi que pour les corpus médicaux et juridiques spécialisés. Sorti il y a environ trois ans, il est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents de sa catégorie. Usages pertinents : recherche sémantique anglophone, RAG sur documents longs, similarité et clustering lorsque la compacité de l’index et l’auto-hébergement priment sur les performances de pointe.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).