Haon-Chen/e5-omni-3B

Haon-Chen/e5-omni-3B est un modèle d’embedding omnimodal publié par Haon-Chen le 6 janvier 2026 sous licence ouverte MIT. Construit sur Qwen2.5-Omni-3B, il compte 5 milliards de paramètres, tous actifs, et produit un vecteur dense unique de 2 048 dimensions, normalisé L2.

Haon-Chen/e5-omni-3B est un modèle d’embedding omnimodal publié par Haon-Chen le 6 janvier 2026 sous licence ouverte MIT. Construit sur Qwen2.5-Omni-3B, il compte 5 milliards de paramètres, tous actifs, et produit un vecteur dense unique de 2 048 dimensions, normalisé L2.

Le modèle place le texte, les images, l’audio et la vidéo dans un espace de représentation unifié, y compris au sein de documents multimodaux. Il prend notamment en charge la recherche textuelle multilingue et intermodale. Ses vecteurs servent à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. L’intégration est possible avec Sentence Transformers ou directement avec Transformers.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurHaon-Chen
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie6 janvier 2026
Dimension du vecteur2 048
Représentationdense à vecteur unique, normalisée L2
Paramètres5 milliards
Paramètres actifs5 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text,image,audio,video → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Image-Text, Lite57,1 %7ᵉ / 49mteb✅ Mesuré
MTEB: MVEB Video-Only55,7 %14ᵉ / 32mteb✅ Mesuré
MTEB: MVEB48,5 %11ᵉ / 15mteb✅ Mesuré
MTEB: MVEB Video-Text48,4 %15ᵉ / 23mteb✅ Mesuré
MTEB: MAEB48,0 %7ᵉ / 21mteb✅ Mesuré
MTEB: MAEB Audio-Only46,6 %10ᵉ / 60mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les meilleurs classements MTEB de Haon-Chen/e5-omni-3B concernent Image-Text, Lite, MAEB et MAEB Audio-Only, où il figure parmi les dix premiers. Ce positionnement met en avant l’alignement entre images et texte ainsi que la représentation de contenus audio, seuls ou associés à du texte. Son espace unifié facilite aussi la recherche entre plusieurs modalités et la recherche textuelle multilingue. La normalisation L2 simplifie les comparaisons de similarité. La licence MIT autorise l’auto-hébergement et l’adaptation, tandis que la compatibilité avec Sentence Transformers et Transformers facilite l’intégration.

Limites et points d'attention. Les résultats sont moins bien classés sur les ensembles vidéo : MVEB Video-Only se situe hors du groupe de tête, tandis que MVEB et MVEB Video-Text apparaissent dans la partie basse de leurs classements respectifs. Les vecteurs de 2 048 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Les 5 milliards de paramètres actifs impliquent également un modèle substantiel à exécuter. Usages pertinents : recherche sémantique et intermodale, RAG multimodal, similarité et clustering de textes, images, contenus audio ou vidéo.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).