jinaai/jina-embeddings-v4

Publié par Jina AI le 24 juin 2025, jinaai/jina-embeddings-v4 est un modèle d’embedding multimodal et multilingue de 4 milliards de paramètres, fondé sur Qwen2.5-VL-3B-Instruct. Il couvre plus de 30 langues et représente de manière unifiée les textes, images et documents visuels.

Publié par Jina AI le 24 juin 2025, jinaai/jina-embeddings-v4 est un modèle d’embedding multimodal et multilingue de 4 milliards de paramètres, fondé sur Qwen2.5-VL-3B-Instruct. Il couvre plus de 30 langues et représente de manière unifiée les textes, images et documents visuels.

Ses vecteurs denses comptent 2 048 dimensions et peuvent être tronqués. Un mode multi-vecteur à interaction tardive complète cette représentation. Le modèle sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, notamment sur des documents complexes comportant tableaux, graphiques ou illustrations. Sa licence CC-BY-NC 4.0 autorise les usages non commerciaux avec attribution.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurJina AI
Poids🟢 Poids ouverts
LicenceCC-BY-NC 4.0
Date de sortie24 juin 2025
Dimension du vecteur2 048
Représentationdense (vecteur unique) + multi-vecteur à interaction tardive
Paramètres4 milliards
Paramètres actifs4 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval69,9 %20ᵉ / 170mteb✅ Mesuré
MTEB: Code Information Retrieval72,9 %19ᵉ / 49mteb✅ Mesuré
MTEB: RTEB Legal54,8 %27ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare58,7 %38ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance70,6 %33ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French51,3 %38ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German63,9 %31ᵉ / 209mteb✅ Mesuré
MTEB: ViDoRe (V1&V2)81,2 %25ᵉ / 48mteb✅ Mesuré
MTEB: Jina Visual Document Retrieval81,0 %1ᵉ / 5mteb✅ Mesuré
MTEB: ViDoRe V357,5 %13ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Long-context Retrieval

▶ jinaai/jina-embeddings-…70 %

MTEB: Code Information Retrieval

▶ jinaai/jina-embeddings-…73 %
Qodo/Qodo-Embed-1-7B71 %

Notre analyse

Forces. Le principal point fort ressort de Jina Visual Document Retrieval, où le modèle occupe la première place de son groupe. Il apparaît particulièrement adapté à la recherche dans des documents multilingues riches en mise en page et en éléments visuels. Ses résultats en Long-context Retrieval le placent également dans le haut du classement, tandis que RTEB German montre une bonne aptitude à la recherche en allemand dans des corpus juridiques, médicaux et commerciaux. Les embeddings denses tronquables permettent d’ajuster la taille des représentations, et le mode multi-vecteur favorise une comparaison plus fine des contenus.

Limites et points d'attention. Les résultats sont moins distinctifs sur ViDoRe, où le modèle se situe en milieu de tableau malgré un score élevé, et sur RTEB Finance, où il reste derrière de nombreux concurrents. Les vecteurs complets de 2 048 dimensions alourdissent les index et rendent la recherche plus coûteuse qu’avec des représentations plus compactes. Les 4 milliards de paramètres pèsent aussi sur les ressources nécessaires à l’inférence. La licence CC-BY-NC 4.0 restreint les usages commerciaux. Âgé d’environ un an, il est déjà ancien à l’échelle de l’IA et peut être dépassé par des modèles plus récents de sa catégorie. Usages pertinents : recherche documentaire multimodale et multilingue, RAG sur documents complexes, similarité et clustering en contexte non commercial.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).