nvidia/omni-embed-nemotron-3b
nvidia/omni-embed-nemotron-3b est un modèle d’embedding multimodal de NVIDIA, sorti le 1er octobre 2025. Ses 5 milliards de paramètres, tous actifs, produisent une représentation dense unique de 2 048 dimensions. Son architecture Transformer repose sur le composant Thinker de…
nvidia/omni-embed-nemotron-3b est un modèle d’embedding multimodal de NVIDIA, sorti le 1er octobre 2025. Ses 5 milliards de paramètres, tous actifs, produisent une représentation dense unique de 2 048 dimensions. Son architecture Transformer repose sur le composant Thinker de Qwen2.5-Omni-3B, sans module Talker.
Le modèle encode du texte, des images, de l’audio et de la vidéo, séparément ou conjointement. Son architecture bi-encodeur place requêtes et contenus dans un espace vectoriel partagé, tandis que les flux audio et vidéo sont encodés séparément. Elle convient à la recherche sémantique et multimodale, au RAG, à la mesure de similarité et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | NVIDIA |
| Poids | 🟢 Poids ouverts |
| Licence | https://huggingface.co/nvidia/omni-embed-nemotron-3b/blob/main/LICENSE |
| Date de sortie | 1 octobre 2025 |
| Dimension du vecteur | 2 048 |
| Représentation | vecteur dense unique de dimension 2048 |
| Paramètres | 5 milliards |
| Paramètres actifs | 5 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text,image,audio,video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MVEB Video-Only | 54,7 % | 18ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: MVEB | 42,8 % | 13ᵉ / 15 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Text | 35,8 % | 22ᵉ / 23 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MVEB Video-Only
MTEB: MVEB
Notre analyse
Forces. Le résultat le plus favorable apparaît sur MVEB Video-Only, consacré à la qualité des embeddings vidéo pour la classification et la classification par paires. Le modèle se situe toutefois au milieu du classement sur ce track, plutôt que parmi les références dominantes. Son principal atout réside dans la couverture multimodale et dans le bi-encodeur, qui permet de calculer indépendamment les vecteurs des requêtes et des contenus avant leur comparaison. La représentation dense unique simplifie également l’indexation dans une base vectorielle.
Limites et points d'attention. Les résultats sont moins favorables sur MVEB, qui évalue notamment la recherche, la classification et le clustering audiovisuels, et plus faibles encore sur MVEB Video-Text. Ces classements indiquent une compétitivité limitée pour l’alignement entre texte et vidéo ainsi que pour les scénarios audiovisuels combinés. La dimension de 2 048 accroît aussi le stockage de l’index et le coût des calculs de similarité par rapport à des vecteurs moins dimensionnés. Usages pertinents : recherche multimodale, RAG associant plusieurs médias, similarité vidéo et regroupement de contenus multimédias.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).