jinaai/jina-embedding-s-en-v1

Publié par Jina AI le 7 juillet 2023, jinaai/jina-embedding-s-en-v1 est un modèle anglophone de 35 millions de paramètres. Il produit une représentation dense de 512 dimensions et est distribué sous licence ouverte Apache 2.0, ce qui autorise son auto-hébergement.

Publié par Jina AI le 7 juillet 2023, jinaai/jina-embedding-s-en-v1 est un modèle anglophone de 35 millions de paramètres. Il produit une représentation dense de 512 dimensions et est distribué sous licence ouverte Apache 2.0, ce qui autorise son auto-hébergement.

Entraîné sur Linnaeus-Clean, composé de 380 millions de paires de phrases issues de domaines variés, dont des paires requête-document, il sert à la recherche sémantique, au RAG, à la similarité textuelle, au clustering et au reranking. Il peut être utilisé avec Jina AI Finetuner ou sentence-transformers.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurJina AI
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie7 juillet 2023
Dimension du vecteur512
Représentationdense
Paramètres35 millions
Paramètres actifs35 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR38,9 %145ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval34,3 %107ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal31,6 %130ᵉ / 208mteb✅ Mesuré
MTEB: Medical28,4 %120ᵉ / 158mteb✅ Mesuré
MTEB: Legal37,9 %95ᵉ / 157mteb✅ Mesuré
MTEB: European42,8 %106ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French17,7 %138ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German23,6 %110ᵉ / 209mteb✅ Mesuré
MTEB: Dutch32,2 %95ᵉ / 113mteb✅ Mesuré
MTEB: Korean7,8 %85ᵉ / 102mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ jinaai/jina-embedding-s…39 %
deepfile/embedder-100p39 %

MTEB: Long-context Retrieval

▶ jinaai/jina-embedding-s…34 %

Notre analyse

Forces. Les résultats les plus favorables apparaissent sur MTEB European et BEIR, ce qui indique une aptitude relative à représenter des textes pour des tâches européennes et à effectuer de la recherche zero-shot sur des domaines hétérogènes. L'entraînement incluant des paires requête-document correspond directement aux besoins de recherche d'information et de constitution d'un index pour le RAG. Les vecteurs denses de 512 dimensions offrent un format assez compact, favorable à des index plus légers. La licence Apache 2.0 facilite l'intégration, la modification et l'auto-hébergement.

Limites et points d'attention. Les rangs obtenus restent bas sur l'ensemble des tracks communiqués, y compris BEIR et MTEB European. Les performances sont également faibles sur Dutch, Long-context Retrieval, MTEB Legal et RTEB Legal, ce qui limite son intérêt pour le néerlandais, les documents longs et la recherche juridique. Son orientation anglophone réduit sa pertinence multilingue. Sorti en 2023, il est très ancien à l'échelle de l'IA et probablement dépassé par des embeddings plus récents. Usages pertinents : prototypes anglophones, index compacts et pipelines auto-hébergés de recherche sémantique ou de RAG, après validation sur les données ciblées.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).