jinaai/jina-embeddings-v5-omni-nano
Publié par Jina AI le 1er avril 2026, jinaai/jina-embeddings-v5-omni-nano est un modèle d’embedding de 986 millions de paramètres, tous actifs. Ses poids sont ouverts sous licence CC-BY-NC 4.0. Il produit un vecteur dense unique de 768 dimensions, avec troncature Matryoshka et…
Publié par Jina AI le 1er avril 2026, jinaai/jina-embeddings-v5-omni-nano est un modèle d’embedding de 986 millions de paramètres, tous actifs. Ses poids sont ouverts sous licence CC-BY-NC 4.0. Il produit un vecteur dense unique de 768 dimensions, avec troncature Matryoshka et renormalisation L2.
Le modèle place le texte, les images, la vidéo et l’audio dans un espace vectoriel partagé. Il peut aussi fusionner plusieurs modalités dans un même embedding. Des adaptateurs ciblent la recherche sémantique, le RAG, la classification, le clustering et l’appariement de textes. Les composants texte, vision et audio peuvent être chargés séparément.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Jina AI |
| Poids | 🟢 Poids ouverts |
| Licence | CC-BY-NC 4.0 |
| Date de sortie | 1 avril 2026 |
| Dimension du vecteur | 768 |
| Représentation | dense à vecteur unique, avec troncature Matryoshka |
| Paramètres | 986 millions |
| Paramètres actifs | 986 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text,image,audio,video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 63,7 % | 29ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 53,7 % | 30ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 61,1 % | 33ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 64,8 % | 40ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 50,1 % | 45ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 57,8 % | 46ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Spanish | 66,8 % | 11ᵉ / 27 | mteb | ✅ Mesuré |
| MTEB: Thai | 63,5 % | 13ᵉ / 28 | mteb | ✅ Mesuré |
| MTEB: Image only | 59,7 % | 17ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 55,8 % | 16ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 54,5 % | 8ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: MAEB | 50,1 % | 6ᵉ / 21 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Spanish
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent Long-context Retrieval, où le modèle se place dans la première partie du classement. Les évaluations en espagnol et en thaï montrent aussi son intérêt pour des corpus linguistiques variés. La représentation commune aux quatre modalités facilite la recherche dans des collections mêlant documents, images, vidéos et contenus audio. La troncature Matryoshka permet de réduire la taille des vecteurs et d’alléger les index, avec une renormalisation L2 après réduction. Le chargement sélectif des composants simplifie les déploiements limités à certaines modalités.
Limites et points d'attention. Le modèle se situe davantage en milieu de tableau sur RTEB Finance et RTEB Healthcare. Son classement en Image only reste également intermédiaire. Les tracks signalés comme plafonnés départagent mal les modèles à score proche, ce qui limite la portée des comparaisons fines. La licence CC-BY-NC 4.0 restreint les usages commerciaux malgré l’ouverture des poids. La fusion multimodale et le chargement de composants supplémentaires peuvent aussi accroître les besoins de déploiement par rapport à un encodeur limité au texte. Usages pertinents : recherche sémantique multimodale, RAG sur documents longs, clustering et appariement de contenus.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).