NovaSearch/jasper_en_vision_language_v1

Publié par NovaSearch le 11 décembre 2024 sous licence ouverte Apache 2.0, NovaSearch/jasper_en_vision_language_v1 est un modèle d’embedding dense de 2 milliards de paramètres, tous actifs. Il produit des vecteurs de 8 960 dimensions et s’appuie sur dunzhang/stella_en_1.5B_v5 ainsi que…

Publié par NovaSearch le 11 décembre 2024 sous licence ouverte Apache 2.0, NovaSearch/jasper_en_vision_language_v1 est un modèle d’embedding dense de 2 milliards de paramètres, tous actifs. Il produit des vecteurs de 8 960 dimensions et s’appuie sur dunzhang/stella_en_1.5B_v5 ainsi que sur google/siglip-so400m-patch14-384.

Le modèle encode le texte et les images, notamment des documents associant chemins d’images et contenu textuel. Entraîné par distillation à reproduire les vecteurs d’un modèle enseignant, il sert à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNovaSearch
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie11 décembre 2024
Dimension du vecteur8 960
Représentationdense
Paramètres2 milliards
Paramètres actifs2 milliards
Longueur de séquence max131 072 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval60,9 %32ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal47,6 %48ᵉ / 208mteb✅ Mesuré
MTEB: Medical61,2 %18ᵉ / 158mteb✅ Mesuré
MTEB: Legal58,8 %16ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French49,8 %49ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German52,1 %54ᵉ / 209mteb✅ Mesuré
MTEB: Instruction Following0,3 %54ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les évaluations MTEB situent ses meilleurs résultats dans la recherche documentaire médicale et juridique, où il figure parmi les modèles les mieux classés. Long-context Retrieval montre également une aptitude solide à retrouver des informations dans des contenus étendus. Ses résultats en français et en allemand attestent une capacité de recherche au-delà de l’anglais, avec un positionnement toutefois moins élevé que dans ses domaines les plus favorables. L’encodage conjoint du texte et des images élargit son emploi aux corpus documentaires multimodaux. La licence Apache 2.0 autorise la modification et les usages commerciaux.

Limites et points d'attention. Les tracks RTEB French, RTEB German et surtout RTEB Legal le placent davantage dans le premier quart que parmi les tout meilleurs, malgré de bons résultats juridiques sur l’autre évaluation MTEB Legal. La dimension de 8 960 produit des index volumineux et augmente les coûts de stockage, de calcul de similarité et de recherche. Ses 2 milliards de paramètres alourdissent aussi le déploiement. Issu de la génération 2024 et âgé d’environ deux ans, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents. Usages pertinents : recherche médicale ou juridique, RAG documentaire multimodal et clustering sémantique lorsque la qualité prime sur la compacité des index.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).