jinaai/jina-embeddings-v2-small-en
Publié par Jina AI le 27 septembre 2023, jinaai/jina-embeddings-v2-small-en est un modèle d’embedding anglophone de 33 millions de paramètres, fondé sur l’architecture JinaBERT. Il produit des représentations denses de 512 dimensions et accepte des séquences allant jusqu’à 8192 tokens.
Publié par Jina AI le 27 septembre 2023, jinaai/jina-embeddings-v2-small-en est un modèle d’embedding anglophone de 33 millions de paramètres, fondé sur l’architecture JinaBERT. Il produit des représentations denses de 512 dimensions et accepte des séquences allant jusqu’à 8192 tokens.
Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé. Ses vecteurs de phrase ou de paragraphe, obtenus par pooling moyen, servent à la recherche sémantique, au RAG, à la similarité textuelle, au clustering, au reranking et à la recommandation, notamment dans des documents longs.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Jina AI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 27 septembre 2023 |
| Dimension du vecteur | 512 |
| Représentation | dense |
| Paramètres | 33 millions |
| Paramètres actifs | 33 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 45,1 % | 126ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 5,5 % | 168ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 21,6 % | 186ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 32,5 % | 75ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 45,8 % | 76ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 21,0 % | 140ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 16,0 % | 148ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 33,4 % | 122ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 8,3 % | 162ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 2,9 % | 205ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Ses résultats MTEB les plus solides concernent RTEB Finance et BEIR, ce qui en fait surtout un modèle orienté vers la recherche d’information, y compris sur des corpus financiers et des domaines hétérogènes. La fenêtre de 8192 tokens facilite l’encodage de paragraphes et de documents longs. Les vecteurs de 512 dimensions limitent la taille des index par rapport à des représentations plus larges, tandis que les 33 millions de paramètres favorisent un déploiement relativement compact. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d'attention. Les classements MTEB restent modestes, y compris sur ses meilleurs tracks. Les performances sont particulièrement faibles sur European, RTEB Healthcare, RTEB Legal et Medical, avec des positions proches du bas des classements, ce qui limite son intérêt pour les langues européennes autres que l’anglais ainsi que pour les corpus médicaux et juridiques spécialisés. Sorti il y a environ trois ans, il est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents de sa catégorie. Usages pertinents : recherche sémantique anglophone, RAG sur documents longs, similarité et clustering lorsque la compacité de l’index et l’auto-hébergement priment sur les performances de pointe.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).