jinaai/jina-embedding-s-en-v1
Publié par Jina AI le 7 juillet 2023, jinaai/jina-embedding-s-en-v1 est un modèle anglophone de 35 millions de paramètres. Il produit une représentation dense de 512 dimensions et est distribué sous licence ouverte Apache 2.0, ce qui autorise son auto-hébergement.
Publié par Jina AI le 7 juillet 2023, jinaai/jina-embedding-s-en-v1 est un modèle anglophone de 35 millions de paramètres. Il produit une représentation dense de 512 dimensions et est distribué sous licence ouverte Apache 2.0, ce qui autorise son auto-hébergement.
Entraîné sur Linnaeus-Clean, composé de 380 millions de paires de phrases issues de domaines variés, dont des paires requête-document, il sert à la recherche sémantique, au RAG, à la similarité textuelle, au clustering et au reranking. Il peut être utilisé avec Jina AI Finetuner ou sentence-transformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Jina AI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 7 juillet 2023 |
| Dimension du vecteur | 512 |
| Représentation | dense |
| Paramètres | 35 millions |
| Paramètres actifs | 35 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 38,9 % | 145ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 34,3 % | 107ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 31,6 % | 130ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 28,4 % | 120ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 37,9 % | 95ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 42,8 % | 106ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 17,7 % | 138ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 23,6 % | 110ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Dutch | 32,2 % | 95ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Korean | 7,8 % | 85ᵉ / 102 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats les plus favorables apparaissent sur MTEB European et BEIR, ce qui indique une aptitude relative à représenter des textes pour des tâches européennes et à effectuer de la recherche zero-shot sur des domaines hétérogènes. L'entraînement incluant des paires requête-document correspond directement aux besoins de recherche d'information et de constitution d'un index pour le RAG. Les vecteurs denses de 512 dimensions offrent un format assez compact, favorable à des index plus légers. La licence Apache 2.0 facilite l'intégration, la modification et l'auto-hébergement.
Limites et points d'attention. Les rangs obtenus restent bas sur l'ensemble des tracks communiqués, y compris BEIR et MTEB European. Les performances sont également faibles sur Dutch, Long-context Retrieval, MTEB Legal et RTEB Legal, ce qui limite son intérêt pour le néerlandais, les documents longs et la recherche juridique. Son orientation anglophone réduit sa pertinence multilingue. Sorti en 2023, il est très ancien à l'échelle de l'IA et probablement dépassé par des embeddings plus récents. Usages pertinents : prototypes anglophones, index compacts et pipelines auto-hébergés de recherche sémantique ou de RAG, après validation sur les données ciblées.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).