jinaai/jina-embeddings-v5-omni-small

Publié par Jina AI le 1er avril 2026, jinaai/jina-embeddings-v5-omni-small est un modèle d’embedding dense multimodal de 2 milliards de paramètres actifs. Il convertit le texte, les images, la vidéo et l’audio en vecteurs de 1 024 dimensions dans un espace partagé. Il prend en charge des…

Publié par Jina AI le 1er avril 2026, jinaai/jina-embeddings-v5-omni-small est un modèle d’embedding dense multimodal de 2 milliards de paramètres actifs. Il convertit le texte, les images, la vidéo et l’audio en vecteurs de 1 024 dimensions dans un espace partagé. Il prend en charge des contenus en anglais et multilingues.

Le modèle sert à la recherche sémantique, à la récupération de passages pour le RAG, au clustering et à la mesure de similarité. Il comprend des adaptateurs pour le retrieval, la classification et le text-matching. Ses poids sont ouverts sous licence CC-BY-NC 4.0, qui réserve son usage aux contextes non commerciaux.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurJina AI
Poids🟢 Poids ouverts
LicenceCC-BY-NC 4.0
Date de sortie1 avril 2026
Dimension du vecteur1 024
Représentationdense
Paramètres2 milliards
Paramètres actifs2 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text,image,audio,video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval66,4 %21ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal56,4 %24ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare62,3 %28ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance66,1 %38ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French51,3 %39ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German63,6 %32ᵉ / 209mteb✅ Mesuré
MTEB: Image only69,1 %1ᵉ / 45mteb✅ Mesuré
MTEB: Spanish68,2 %8ᵉ / 27mteb✅ Mesuré
MTEB: Image-Text, English65,3 %1ᵉ / 40mteb✅ Mesuré
MTEB: Image-Text, Multilingual65,1 %1ᵉ / 40mteb✅ Mesuré
MTEB: Thai64,2 %9ᵉ / 28mteb✅ Mesuré
MTEB: Image-Text, Lite61,1 %4ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Long-context Retrieval

▶ jinaai/jina-embeddings-…66 %

MTEB: Image only

▶ jinaai/jina-embeddings-…69 %

Notre analyse

Forces. Le modèle se distingue surtout sur les tâches multimodales. Il occupe la première place des tracks MTEB Image only, Image-Text English et Image-Text Multilingual. Son espace vectoriel commun facilite la recherche croisée entre textes, images, vidéos et contenus audio. Le chargement sélectif des modalités limite les composants mobilisés selon l’usage. Les embeddings sont normalisés en L2 et produits par pooling sur le dernier token. Leur troncature selon plusieurs dimensions Matryoshka permet aussi de réduire la taille des index. L’intégration est prévue avec transformers, sentence-transformers, vLLM et Elastic Inference Service.

Limites et points d'attention. Les résultats sont moins dominants en Long-context Retrieval et sur RTEB Finance. Le track Spanish place le modèle dans le premier tiers, mais son plafonnement rend le score peu discriminant. À sa dimension native de 1 024, l’index occupe davantage d’espace et la recherche est plus coûteuse qu’avec ses représentations Matryoshka tronquées. La licence CC-BY-NC 4.0 restreint les déploiements commerciaux malgré l’ouverture des poids. Usages pertinents : recherche multimodale, RAG multilingue, similarité image-texte et clustering de contenus hétérogènes.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).