jinaai/jina-embeddings-v5-omni-small
Publié par Jina AI le 1er avril 2026, jinaai/jina-embeddings-v5-omni-small est un modèle d’embedding dense multimodal de 2 milliards de paramètres actifs. Il convertit le texte, les images, la vidéo et l’audio en vecteurs de 1 024 dimensions dans un espace partagé. Il prend en charge des…
Publié par Jina AI le 1er avril 2026, jinaai/jina-embeddings-v5-omni-small est un modèle d’embedding dense multimodal de 2 milliards de paramètres actifs. Il convertit le texte, les images, la vidéo et l’audio en vecteurs de 1 024 dimensions dans un espace partagé. Il prend en charge des contenus en anglais et multilingues.
Le modèle sert à la recherche sémantique, à la récupération de passages pour le RAG, au clustering et à la mesure de similarité. Il comprend des adaptateurs pour le retrieval, la classification et le text-matching. Ses poids sont ouverts sous licence CC-BY-NC 4.0, qui réserve son usage aux contextes non commerciaux.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Jina AI |
| Poids | 🟢 Poids ouverts |
| Licence | CC-BY-NC 4.0 |
| Date de sortie | 1 avril 2026 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text,image,audio,video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 66,4 % | 21ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 56,4 % | 24ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 62,3 % | 28ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 66,1 % | 38ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 51,3 % | 39ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 63,6 % | 32ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Image only | 69,1 % | 1ᵉ / 45 | mteb | ✅ Mesuré |
| MTEB: Spanish | 68,2 % | 8ᵉ / 27 | mteb | ✅ Mesuré |
| MTEB: Image-Text, English | 65,3 % | 1ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Multilingual | 65,1 % | 1ᵉ / 40 | mteb | ✅ Mesuré |
| MTEB: Thai | 64,2 % | 9ᵉ / 28 | mteb | ✅ Mesuré |
| MTEB: Image-Text, Lite | 61,1 % | 4ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Image only
Notre analyse
Forces. Le modèle se distingue surtout sur les tâches multimodales. Il occupe la première place des tracks MTEB Image only, Image-Text English et Image-Text Multilingual. Son espace vectoriel commun facilite la recherche croisée entre textes, images, vidéos et contenus audio. Le chargement sélectif des modalités limite les composants mobilisés selon l’usage. Les embeddings sont normalisés en L2 et produits par pooling sur le dernier token. Leur troncature selon plusieurs dimensions Matryoshka permet aussi de réduire la taille des index. L’intégration est prévue avec transformers, sentence-transformers, vLLM et Elastic Inference Service.
Limites et points d'attention. Les résultats sont moins dominants en Long-context Retrieval et sur RTEB Finance. Le track Spanish place le modèle dans le premier tiers, mais son plafonnement rend le score peu discriminant. À sa dimension native de 1 024, l’index occupe davantage d’espace et la recherche est plus coûteuse qu’avec ses représentations Matryoshka tronquées. La licence CC-BY-NC 4.0 restreint les déploiements commerciaux malgré l’ouverture des poids. Usages pertinents : recherche multimodale, RAG multilingue, similarité image-texte et clustering de contenus hétérogènes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).