nvidia/omni-embed-nemotron-3b

nvidia/omni-embed-nemotron-3b est un modèle d’embedding multimodal de NVIDIA, sorti le 1er octobre 2025. Ses 5 milliards de paramètres, tous actifs, produisent une représentation dense unique de 2 048 dimensions. Son architecture Transformer repose sur le composant Thinker de…

nvidia/omni-embed-nemotron-3b est un modèle d’embedding multimodal de NVIDIA, sorti le 1er octobre 2025. Ses 5 milliards de paramètres, tous actifs, produisent une représentation dense unique de 2 048 dimensions. Son architecture Transformer repose sur le composant Thinker de Qwen2.5-Omni-3B, sans module Talker.

Le modèle encode du texte, des images, de l’audio et de la vidéo, séparément ou conjointement. Son architecture bi-encodeur place requêtes et contenus dans un espace vectoriel partagé, tandis que les flux audio et vidéo sont encodés séparément. Elle convient à la recherche sémantique et multimodale, au RAG, à la mesure de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNVIDIA
Poids🟢 Poids ouverts
Licencehttps://huggingface.co/nvidia/omni-embed-nemotron-3b/blob/main/LICENSE
Date de sortie1 octobre 2025
Dimension du vecteur2 048
Représentationvecteur dense unique de dimension 2048
Paramètres5 milliards
Paramètres actifs5 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text,image,audio,video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MVEB Video-Only54,7 %18ᵉ / 32mteb✅ Mesuré
MTEB: MVEB42,8 %13ᵉ / 15mteb✅ Mesuré
MTEB: MVEB Video-Text35,8 %22ᵉ / 23mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MVEB Video-Only

▶ nvidia/omni-embed-nemot…55 %
VLM2Vec/VLM2Vec-V2.053 %

MTEB: MVEB

▶ nvidia/omni-embed-nemot…43 %

Notre analyse

Forces. Le résultat le plus favorable apparaît sur MVEB Video-Only, consacré à la qualité des embeddings vidéo pour la classification et la classification par paires. Le modèle se situe toutefois au milieu du classement sur ce track, plutôt que parmi les références dominantes. Son principal atout réside dans la couverture multimodale et dans le bi-encodeur, qui permet de calculer indépendamment les vecteurs des requêtes et des contenus avant leur comparaison. La représentation dense unique simplifie également l’indexation dans une base vectorielle.

Limites et points d'attention. Les résultats sont moins favorables sur MVEB, qui évalue notamment la recherche, la classification et le clustering audiovisuels, et plus faibles encore sur MVEB Video-Text. Ces classements indiquent une compétitivité limitée pour l’alignement entre texte et vidéo ainsi que pour les scénarios audiovisuels combinés. La dimension de 2 048 accroît aussi le stockage de l’index et le coût des calculs de similarité par rapport à des vecteurs moins dimensionnés. Usages pertinents : recherche multimodale, RAG associant plusieurs médias, similarité vidéo et regroupement de contenus multimédias.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).