nvidia/NV-Embed-v2

Publié par NVIDIA le 9 septembre 2024, nvidia/NV-Embed-v2 est un modèle d'embedding dense de 8 milliards de paramètres, tous actifs. Fondé sur Mistral-7B-v0.1, il produit des vecteurs de 4 096 dimensions grâce à un pooling Latent-Attention.

Publié par NVIDIA le 9 septembre 2024, nvidia/NV-Embed-v2 est un modèle d'embedding dense de 8 milliards de paramètres, tous actifs. Fondé sur Mistral-7B-v0.1, il produit des vecteurs de 4 096 dimensions grâce à un pooling Latent-Attention.

Le modèle sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, sans générer de texte. Il couvre notamment le français et plusieurs langues européennes. Sa licence CC-BY-NC 4.0 autorise le partage et l'adaptation avec attribution, mais exclut les usages commerciaux.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNVIDIA
Poids🟢 Poids ouverts
LicenceCC-BY-NC 4.0
Date de sortie9 septembre 2024
Dimension du vecteur4 096
Représentationdense
Paramètres8 milliards
Paramètres actifs8 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR63,2 %3ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval25,4 %140ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal35,8 %92ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare67,3 %11ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance71,5 %31ᵉ / 97mteb✅ Mesuré
MTEB: Medical63,6 %11ᵉ / 158mteb✅ Mesuré
MTEB: Legal44,3 %55ᵉ / 157mteb✅ Mesuré
MTEB: European58,6 %25ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French61,5 %7ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German18,4 %124ᵉ / 209mteb✅ Mesuré
MTEB: Indic56,3 %39ᵉ / 119mteb✅ Mesuré
MTEB: Instruction Following1,0 %33ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ nvidia/NV-Embed-v263 %

MTEB: Long-context Retrieval

bigscience/sgpt-bloom-7…29 %
▶ nvidia/NV-Embed-v225 %

Notre analyse

Forces. NV-Embed-v2 se distingue surtout en recherche d'information généraliste zero-shot sur BEIR, où il figure parmi les meilleurs modèles évalués. Ses résultats sont également solides pour le retrieval en français, notamment sur des contenus juridiques et de connaissances générales, ainsi que dans les domaines médical, biomédical et de santé. Le modèle accepte des instructions pour orienter les requêtes, tandis que les passages à indexer n'en nécessitent pas. Son entraînement combine un ajustement par instructions en deux étapes et une sélection de négatifs difficiles tenant compte de la pertinence positive.

Limites et points d'attention. Ses performances sont moins compétitives sur l'ensemble European et en finance que sur BEIR, le français ou la santé. Les vecteurs de 4 096 dimensions alourdissent les index et augmentent le coût de stockage et de recherche par rapport à des représentations plus compactes. Avec 8 milliards de paramètres actifs, le déploiement est également conséquent. La licence CC-BY-NC 4.0 restreint l'exploitation commerciale. Sorti en 2024, il appartient désormais à une génération ancienne à l'échelle de l'IA et peut être dépassé ou retiré des catalogues actuels. Usages pertinents : retrieval zero-shot, RAG documentaire, recherche médicale ou francophone et clustering hors contexte commercial.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).