NovaSearch/jasper_en_vision_language_v1
Publié par NovaSearch le 11 décembre 2024 sous licence ouverte Apache 2.0, NovaSearch/jasper_en_vision_language_v1 est un modèle d’embedding dense de 2 milliards de paramètres, tous actifs. Il produit des vecteurs de 8 960 dimensions et s’appuie sur dunzhang/stella_en_1.5B_v5 ainsi que…
Publié par NovaSearch le 11 décembre 2024 sous licence ouverte Apache 2.0, NovaSearch/jasper_en_vision_language_v1 est un modèle d’embedding dense de 2 milliards de paramètres, tous actifs. Il produit des vecteurs de 8 960 dimensions et s’appuie sur dunzhang/stella_en_1.5B_v5 ainsi que sur google/siglip-so400m-patch14-384.
Le modèle encode le texte et les images, notamment des documents associant chemins d’images et contenu textuel. Entraîné par distillation à reproduire les vecteurs d’un modèle enseignant, il sert à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | NovaSearch |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 11 décembre 2024 |
| Dimension du vecteur | 8 960 |
| Représentation | dense |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 131 072 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 60,9 % | 32ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 47,6 % | 48ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 61,2 % | 18ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 58,8 % | 16ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 49,8 % | 49ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 52,1 % | 54ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 0,3 % | 54ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Medical
Notre analyse
Forces. Les évaluations MTEB situent ses meilleurs résultats dans la recherche documentaire médicale et juridique, où il figure parmi les modèles les mieux classés. Long-context Retrieval montre également une aptitude solide à retrouver des informations dans des contenus étendus. Ses résultats en français et en allemand attestent une capacité de recherche au-delà de l’anglais, avec un positionnement toutefois moins élevé que dans ses domaines les plus favorables. L’encodage conjoint du texte et des images élargit son emploi aux corpus documentaires multimodaux. La licence Apache 2.0 autorise la modification et les usages commerciaux.
Limites et points d'attention. Les tracks RTEB French, RTEB German et surtout RTEB Legal le placent davantage dans le premier quart que parmi les tout meilleurs, malgré de bons résultats juridiques sur l’autre évaluation MTEB Legal. La dimension de 8 960 produit des index volumineux et augmente les coûts de stockage, de calcul de similarité et de recherche. Ses 2 milliards de paramètres alourdissent aussi le déploiement. Issu de la génération 2024 et âgé d’environ deux ans, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents. Usages pertinents : recherche médicale ou juridique, RAG documentaire multimodal et clustering sémantique lorsque la qualité prime sur la compacité des index.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).