jinaai/jina-embeddings-v3

Publié par Jina AI le 18 septembre 2024, jinaai/jina-embeddings-v3 est un modèle d'embedding multilingue de 572 millions de paramètres, fondé sur Jina-XLM-RoBERTa. Il produit des vecteurs denses de 1024 dimensions et traite des séquences atteignant 8192 tokens grâce à RoPE.

Publié par Jina AI le 18 septembre 2024, jinaai/jina-embeddings-v3 est un modèle d'embedding multilingue de 572 millions de paramètres, fondé sur Jina-XLM-RoBERTa. Il produit des vecteurs denses de 1024 dimensions et traite des séquences atteignant 8192 tokens grâce à RoPE.

Conçu pour la recherche sémantique, le RAG, la similarité et le clustering, il couvre 100 langues, avec un ajustement ciblé sur 30 d'entre elles. Ses embeddings Matryoshka sont tronquables de 1024 à 32 dimensions. La licence CC-BY-NC 4.0 autorise les usages non commerciaux sous réserve d'attribution.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurJina AI
Poids🟢 Poids ouverts
LicenceCC-BY-NC 4.0
Date de sortie18 septembre 2024
Dimension du vecteur1 024
Représentationdense, avec embeddings Matryoshka à dimensions tronquables
Paramètres572 millions
Paramètres actifs572 millions
Longueur de séquence max8 194 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR53,2 %62ᵉ / 192mteb✅ Mesuré
MTEB: BEIR-NL45,6 %4ᵉ / 16mteb✅ Mesuré
MTEB: Long-context Retrieval55,7 %38ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal46,5 %58ᵉ / 208mteb✅ Mesuré
MTEB: Medical59,5 %23ᵉ / 158mteb✅ Mesuré
MTEB: Legal56,9 %18ᵉ / 157mteb✅ Mesuré
MTEB: European60,7 %18ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French44,4 %61ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German59,4 %41ᵉ / 209mteb✅ Mesuré
MTEB: Korean69,1 %10ᵉ / 102mteb✅ Mesuré
MTEB: Farsi65,3 %11ᵉ / 30mteb✅ Mesuré
MTEB: Russian63,6 %16ᵉ / 104mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

w601sxs/b1ade-embed53 %
▶ jinaai/jina-embeddings-…53 %

MTEB: BEIR-NL

▶ jinaai/jina-embeddings-…46 %
bge-m345 %

Notre analyse

Forces. jinaai/jina-embeddings-v3 se distingue surtout par sa polyvalence multilingue. Ses résultats MTEB le placent dans le top 10 en coréen et en allemand, tandis que les évaluations russe, persane et européennes confirment une couverture linguistique étendue pour la classification, le clustering, le reranking et la recherche. Cinq adaptateurs LoRA spécialisent les vecteurs pour les requêtes, les passages, la séparation, la classification ou l'appariement de textes. La fenêtre de 8192 tokens facilite l'indexation de documents longs. Les dimensions Matryoshka permettent aussi d'alléger les index et d'accélérer la recherche en tronquant les vecteurs.

Limites et points d'attention. Le positionnement est moins favorable sur MTEB Medical que sur ses meilleurs tracks linguistiques, ce qui invite à valider le modèle sur les corpus cliniques, biomédicaux ou de santé visés. À 1024 dimensions, les vecteurs complets augmentent le stockage et le coût de recherche, même si la troncature offre un compromis. La licence CC-BY-NC 4.0 restreint l'exploitation commerciale. Sorti en 2024, le modèle est ancien à l'échelle de l'IA et peut être dépassé par des embeddings plus récents de son segment. Usages pertinents : recherche multilingue, RAG sur documents longs, déduplication, similarité et clustering non commerciaux.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).