jinaai/jina-embeddings-v5-text-nano
Publié par Jina AI le 17 février 2026, jinaai/jina-embeddings-v5-text-nano est un modèle d’embedding textuel multilingue de 212 millions de paramètres actifs. Fondé sur EuroBERT-210M, il produit des vecteurs denses de 768 dimensions. Ses poids sont ouverts sous licence CC-BY-NC 4.0.
Publié par Jina AI le 17 février 2026, jinaai/jina-embeddings-v5-text-nano est un modèle d’embedding textuel multilingue de 212 millions de paramètres actifs. Fondé sur EuroBERT-210M, il produit des vecteurs denses de 768 dimensions. Ses poids sont ouverts sous licence CC-BY-NC 4.0.
Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, à la couche de recherche d’un système RAG, à l’appariement, à la classification et au clustering. Il utilise un pooling sur le dernier token et des adaptateurs propres à chaque tâche. Il ne génère pas de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Jina AI |
| Poids | 🟢 Poids ouverts |
| Licence | CC-BY-NC 4.0 |
| Date de sortie | 17 février 2026 |
| Dimension du vecteur | 768 |
| Représentation | dense avec dimensions Matryoshka et quantification binaire |
| Paramètres | 212 millions |
| Paramètres actifs | 212 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 63,7 % | 29ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 53,7 % | 30ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 61,1 % | 33ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 64,8 % | 40ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 50,1 % | 45ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 57,8 % | 46ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Spanish | 66,8 % | 11ᵉ / 27 | mteb | ✅ Mesuré |
| MTEB: Thai | 63,5 % | 13ᵉ / 28 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 0,0 % | 59ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Spanish
Notre analyse
Forces. Les meilleurs placements relatifs apparaissent sur MTEB Long-context Retrieval et RTEB German. Ce dernier couvre notamment des contenus juridiques, médicaux et professionnels en allemand. Les résultats en espagnol et en thaï confirment aussi l’intérêt du modèle pour des corpus multilingues. L’entraînement combine une distillation depuis Qwen3-Embedding-4B et des pertes contrastives adaptées aux tâches. Les dimensions Matryoshka permettent de réduire les vecteurs à 32, 64, 128, 256 ou 512 dimensions au lieu de 768. Cette modularité, associée à la quantification binaire, peut alléger l’index et accélérer la recherche. Les poids ouverts autorisent un déploiement auto-hébergé dans le cadre de la licence.
Limites et points d'attention. Les tracks Thai et RTEB Finance se situent davantage vers le milieu de leurs classements respectifs. RTEB Healthcare reste dans la première moitié, sans figurer parmi les toutes premières positions. Tous les rangs indiqués sont partagés avec un autre modèle et les benchmarks sont plafonnés, ce qui réduit leur pouvoir discriminant. Un index conservant les 768 dimensions demande plus de stockage et de calcul qu’une variante Matryoshka réduite. La licence CC-BY-NC 4.0 restreint les usages commerciaux. Usages pertinents : recherche multilingue, RAG documentaire, appariement de textes et clustering dans des projets non commerciaux.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).