Haon-Chen/e5-omni-3B
Haon-Chen/e5-omni-3B est un modèle d’embedding omnimodal publié par Haon-Chen le 6 janvier 2026 sous licence ouverte MIT. Construit sur Qwen2.5-Omni-3B, il compte 5 milliards de paramètres, tous actifs, et produit un vecteur dense unique de 2 048 dimensions, normalisé L2.
Haon-Chen/e5-omni-3B est un modèle d’embedding omnimodal publié par Haon-Chen le 6 janvier 2026 sous licence ouverte MIT. Construit sur Qwen2.5-Omni-3B, il compte 5 milliards de paramètres, tous actifs, et produit un vecteur dense unique de 2 048 dimensions, normalisé L2.
Le modèle place le texte, les images, l’audio et la vidéo dans un espace de représentation unifié, y compris au sein de documents multimodaux. Il prend notamment en charge la recherche textuelle multilingue et intermodale. Ses vecteurs servent à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. L’intégration est possible avec Sentence Transformers ou directement avec Transformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Haon-Chen |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 6 janvier 2026 |
| Dimension du vecteur | 2 048 |
| Représentation | dense à vecteur unique, normalisée L2 |
| Paramètres | 5 milliards |
| Paramètres actifs | 5 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text,image,audio,video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image-Text, Lite | 57,1 % | 7ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Only | 55,7 % | 14ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: MVEB | 48,5 % | 11ᵉ / 15 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Text | 48,4 % | 15ᵉ / 23 | mteb | ✅ Mesuré |
| MTEB: MAEB | 48,0 % | 7ᵉ / 21 | mteb | ✅ Mesuré |
| MTEB: MAEB Audio-Only | 46,6 % | 10ᵉ / 60 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image-Text, Lite
MTEB: MVEB Video-Only
Notre analyse
Forces. Les meilleurs classements MTEB de Haon-Chen/e5-omni-3B concernent Image-Text, Lite, MAEB et MAEB Audio-Only, où il figure parmi les dix premiers. Ce positionnement met en avant l’alignement entre images et texte ainsi que la représentation de contenus audio, seuls ou associés à du texte. Son espace unifié facilite aussi la recherche entre plusieurs modalités et la recherche textuelle multilingue. La normalisation L2 simplifie les comparaisons de similarité. La licence MIT autorise l’auto-hébergement et l’adaptation, tandis que la compatibilité avec Sentence Transformers et Transformers facilite l’intégration.
Limites et points d'attention. Les résultats sont moins bien classés sur les ensembles vidéo : MVEB Video-Only se situe hors du groupe de tête, tandis que MVEB et MVEB Video-Text apparaissent dans la partie basse de leurs classements respectifs. Les vecteurs de 2 048 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Les 5 milliards de paramètres actifs impliquent également un modèle substantiel à exécuter. Usages pertinents : recherche sémantique et intermodale, RAG multimodal, similarité et clustering de textes, images, contenus audio ou vidéo.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).