jinaai/jina-embeddings-v5-text-small
Publié par Jina AI le 17 février 2026, jinaai/jina-embeddings-v5-text-small est un modèle d’embedding multilingue de 596 millions de paramètres actifs. Ses poids sont ouverts sous licence CC-BY-NC 4.0. Il accepte plus de 119 langues et des séquences atteignant 32 768 tokens.
Publié par Jina AI le 17 février 2026, jinaai/jina-embeddings-v5-text-small est un modèle d’embedding multilingue de 596 millions de paramètres actifs. Ses poids sont ouverts sous licence CC-BY-NC 4.0. Il accepte plus de 119 langues et des séquences atteignant 32 768 tokens.
Fondé sur Qwen3-0.6B-Base, il produit des vecteurs denses de 1 024 dimensions avec pooling sur le dernier token. Ses dimensions Matryoshka sont configurables. Le modèle cible la recherche sémantique, le RAG, la mise en correspondance de textes, la classification et le clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Jina AI |
| Poids | 🟢 Poids ouverts |
| Licence | CC-BY-NC 4.0 |
| Date de sortie | 17 février 2026 |
| Dimension du vecteur | 1 024 |
| Représentation | dense avec dimensions Matryoshka |
| Paramètres | 596 millions |
| Paramètres actifs | 596 millions |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 66,4 % | 21ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 56,4 % | 24ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 62,3 % | 28ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 66,1 % | 38ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 51,3 % | 39ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 63,6 % | 32ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Spanish | 68,2 % | 8ᵉ / 27 | mteb | ✅ Mesuré |
| MTEB: Thai | 64,2 % | 9ᵉ / 28 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 1,3 % | 29ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Spanish
Notre analyse
Forces. Sur MTEB, ses positions les plus solides concernent Long-context Retrieval et RTEB German. Ce profil sert la recherche dans des documents longs ainsi que le retrieval en allemand dans les domaines juridique, médical et économique. Les tracks Spanish et Thai confirment son intérêt pour la classification, le clustering et la similarité multilingues. Les dimensions Matryoshka et la robustesse à la troncature permettent de raccourcir les vecteurs afin d’alléger les index. La compatibilité avec la quantification binaire offre un autre levier de compression. Les poids ouverts autorisent aussi l’auto-hébergement.
Limites et points d'attention. RTEB Finance place le modèle davantage en milieu de tableau. RTEB Healthcare reste également hors du groupe de tête. Les benchmarks sont plafonnés et comportent des ex aequo, ce qui limite la portée des écarts affichés. À pleine dimension, les vecteurs de 1 024 composantes occupent plus d’espace et rendent la recherche plus coûteuse que leurs versions Matryoshka raccourcies. La licence CC-BY-NC 4.0 restreint les usages commerciaux. Les usages pertinents sont le RAG multilingue, la recherche sémantique sur des documents longs et le clustering dans des déploiements non commerciaux auto-hébergés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).