jinaai/jina-embeddings-v5-text-nano

Publié par Jina AI le 17 février 2026, jinaai/jina-embeddings-v5-text-nano est un modèle d’embedding textuel multilingue de 212 millions de paramètres actifs. Fondé sur EuroBERT-210M, il produit des vecteurs denses de 768 dimensions. Ses poids sont ouverts sous licence CC-BY-NC 4.0.

Publié par Jina AI le 17 février 2026, jinaai/jina-embeddings-v5-text-nano est un modèle d’embedding textuel multilingue de 212 millions de paramètres actifs. Fondé sur EuroBERT-210M, il produit des vecteurs denses de 768 dimensions. Ses poids sont ouverts sous licence CC-BY-NC 4.0.

Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, à la couche de recherche d’un système RAG, à l’appariement, à la classification et au clustering. Il utilise un pooling sur le dernier token et des adaptateurs propres à chaque tâche. Il ne génère pas de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurJina AI
Poids🟢 Poids ouverts
LicenceCC-BY-NC 4.0
Date de sortie17 février 2026
Dimension du vecteur768
Représentationdense avec dimensions Matryoshka et quantification binaire
Paramètres212 millions
Paramètres actifs212 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval63,7 %29ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal53,7 %30ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare61,1 %33ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance64,8 %40ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French50,1 %45ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German57,8 %46ᵉ / 209mteb✅ Mesuré
MTEB: Spanish66,8 %11ᵉ / 27mteb✅ Mesuré
MTEB: Thai63,5 %13ᵉ / 28mteb✅ Mesuré
MTEB: Instruction Following0,0 %59ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les meilleurs placements relatifs apparaissent sur MTEB Long-context Retrieval et RTEB German. Ce dernier couvre notamment des contenus juridiques, médicaux et professionnels en allemand. Les résultats en espagnol et en thaï confirment aussi l’intérêt du modèle pour des corpus multilingues. L’entraînement combine une distillation depuis Qwen3-Embedding-4B et des pertes contrastives adaptées aux tâches. Les dimensions Matryoshka permettent de réduire les vecteurs à 32, 64, 128, 256 ou 512 dimensions au lieu de 768. Cette modularité, associée à la quantification binaire, peut alléger l’index et accélérer la recherche. Les poids ouverts autorisent un déploiement auto-hébergé dans le cadre de la licence.

Limites et points d'attention. Les tracks Thai et RTEB Finance se situent davantage vers le milieu de leurs classements respectifs. RTEB Healthcare reste dans la première moitié, sans figurer parmi les toutes premières positions. Tous les rangs indiqués sont partagés avec un autre modèle et les benchmarks sont plafonnés, ce qui réduit leur pouvoir discriminant. Un index conservant les 768 dimensions demande plus de stockage et de calcul qu’une variante Matryoshka réduite. La licence CC-BY-NC 4.0 restreint les usages commerciaux. Usages pertinents : recherche multilingue, RAG documentaire, appariement de textes et clustering dans des projets non commerciaux.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).