Tevatron/OmniEmbed-v0.1

Tevatron/OmniEmbed-v0.1 est un modèle d’embedding multimodal de 9 milliards de paramètres, publié par Tevatron le 12 avril 2025 sous licence ouverte MIT. Construit sur Qwen2.5-Omni-7B, il produit un vecteur dense unique, normalisé et multilingue de 3 584 dimensions.

Tevatron/OmniEmbed-v0.1 est un modèle d’embedding multimodal de 9 milliards de paramètres, publié par Tevatron le 12 avril 2025 sous licence ouverte MIT. Construit sur Qwen2.5-Omni-7B, il produit un vecteur dense unique, normalisé et multilingue de 3 584 dimensions.

Le modèle unifie le texte, les images, l’audio et la vidéo dans un même espace vectoriel. Il sert à la recherche sémantique et cross-modale, au RAG, à la mesure de similarité et au clustering. Les documents peuvent associer plusieurs modalités, tandis que des interfaces distinctes permettent d’encoder requêtes et documents.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurTevatron
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie12 avril 2025
Dimension du vecteur3 584
Représentationvecteur dense unique normalisé
Paramètres9 milliards
Paramètres actifs9 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text,image,audio,video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image-Text, Lite58,3 %6ᵉ / 49mteb✅ Mesuré
MTEB: MVEB Video-Only57,9 %7ᵉ / 32mteb✅ Mesuré
MTEB: MVEB52,9 %8ᵉ / 15mteb✅ Mesuré
MTEB: MVEB Video-Text51,3 %12ᵉ / 23mteb✅ Mesuré
MTEB: MAEB Audio-Only47,3 %9ᵉ / 60mteb✅ Mesuré
MTEB: MAEB43,9 %8ᵉ / 21mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. OmniEmbed-v0.1 se classe parmi les dix premiers sur plusieurs tracks MTEB consacrés aux embeddings multimodaux. Ses meilleurs positionnements concernent Image-Text Lite, la vidéo seule, l’audiovisuel et l’audio seul. Ce profil le rend particulièrement adapté au rapprochement de contenus entre texte, image, son et vidéo, ainsi qu’aux tâches de retrieval, classification, clustering et comparaison de paires couvertes par ces évaluations. La licence MIT facilite l’auto-hébergement et l’intégration dans des systèmes propriétaires. La compatibilité avec Sentence Transformers et Transformers simplifie aussi l’encodage séparé des requêtes et des documents.

Limites et points d’attention. Le track MVEB Video-Text est moins favorable que les autres évaluations multimodales, avec un classement hors du top 10. Les vecteurs de 3 584 dimensions alourdissent les index, la mémoire nécessaire et le coût des recherches de similarité. Les 9 milliards de paramètres, tous actifs, imposent également une infrastructure substantielle pour l’inférence. Âgé d’environ un an, un intervalle très long à l’échelle de l’IA, le modèle peut être dépassé par des références plus récentes et ne plus figurer dans certains catalogues. Usages pertinents : recherche cross-modale, indexation multimédia, RAG multimodal et clustering de corpus mêlant texte, images, audio et vidéo.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).