jinaai/jina-embeddings-v5-text-small

Publié par Jina AI le 17 février 2026, jinaai/jina-embeddings-v5-text-small est un modèle d’embedding multilingue de 596 millions de paramètres actifs. Ses poids sont ouverts sous licence CC-BY-NC 4.0. Il accepte plus de 119 langues et des séquences atteignant 32 768 tokens.

Publié par Jina AI le 17 février 2026, jinaai/jina-embeddings-v5-text-small est un modèle d’embedding multilingue de 596 millions de paramètres actifs. Ses poids sont ouverts sous licence CC-BY-NC 4.0. Il accepte plus de 119 langues et des séquences atteignant 32 768 tokens.

Fondé sur Qwen3-0.6B-Base, il produit des vecteurs denses de 1 024 dimensions avec pooling sur le dernier token. Ses dimensions Matryoshka sont configurables. Le modèle cible la recherche sémantique, le RAG, la mise en correspondance de textes, la classification et le clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurJina AI
Poids🟢 Poids ouverts
LicenceCC-BY-NC 4.0
Date de sortie17 février 2026
Dimension du vecteur1 024
Représentationdense avec dimensions Matryoshka
Paramètres596 millions
Paramètres actifs596 millions
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval66,4 %21ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal56,4 %24ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare62,3 %28ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance66,1 %38ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French51,3 %39ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German63,6 %32ᵉ / 209mteb✅ Mesuré
MTEB: Spanish68,2 %8ᵉ / 27mteb✅ Mesuré
MTEB: Thai64,2 %9ᵉ / 28mteb✅ Mesuré
MTEB: Instruction Following1,3 %29ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Sur MTEB, ses positions les plus solides concernent Long-context Retrieval et RTEB German. Ce profil sert la recherche dans des documents longs ainsi que le retrieval en allemand dans les domaines juridique, médical et économique. Les tracks Spanish et Thai confirment son intérêt pour la classification, le clustering et la similarité multilingues. Les dimensions Matryoshka et la robustesse à la troncature permettent de raccourcir les vecteurs afin d’alléger les index. La compatibilité avec la quantification binaire offre un autre levier de compression. Les poids ouverts autorisent aussi l’auto-hébergement.

Limites et points d'attention. RTEB Finance place le modèle davantage en milieu de tableau. RTEB Healthcare reste également hors du groupe de tête. Les benchmarks sont plafonnés et comportent des ex aequo, ce qui limite la portée des écarts affichés. À pleine dimension, les vecteurs de 1 024 composantes occupent plus d’espace et rendent la recherche plus coûteuse que leurs versions Matryoshka raccourcies. La licence CC-BY-NC 4.0 restreint les usages commerciaux. Les usages pertinents sont le RAG multilingue, la recherche sémantique sur des documents longs et le clustering dans des déploiements non commerciaux auto-hébergés.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).