Haon-Chen/e5-omni-7B
Publié le 6 janvier 2026 par Haon-Chen sous licence ouverte MIT, e5-omni-7B est un modèle d’embedding omni-modal construit sur Qwen2.5-Omni-7B. Ses 9 milliards de paramètres, tous actifs, produisent des vecteurs denses de 3 584 dimensions dans un espace unifié.
Publié le 6 janvier 2026 par Haon-Chen sous licence ouverte MIT, e5-omni-7B est un modèle d’embedding omni-modal construit sur Qwen2.5-Omni-7B. Ses 9 milliards de paramètres, tous actifs, produisent des vecteurs denses de 3 584 dimensions dans un espace unifié.
Le modèle représente le texte, les images, l’audio et la vidéo, y compris au sein de documents multimodaux. Il prend notamment en charge la récupération croisée entre une requête textuelle et différents médias, ainsi que la recherche textuelle multilingue. Ces représentations servent à la recherche sémantique, au RAG, à la mesure de similarité et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Haon-Chen |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 6 janvier 2026 |
| Dimension du vecteur | 3 584 |
| Représentation | dense (espace d'embedding unique et unifié) |
| Paramètres | 9 milliards |
| Paramètres actifs | 9 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text,image,audio,video → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Image-Text, Lite | 65,2 % | 3ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Only | 55,7 % | 13ᵉ / 32 | mteb | ✅ Mesuré |
| MTEB: MVEB | 55,0 % | 4ᵉ / 15 | mteb | ✅ Mesuré |
| MTEB: MVEB Video-Text | 54,1 % | 5ᵉ / 23 | mteb | ✅ Mesuré |
| MTEB: MAEB | 52,5 % | 2ᵉ / 21 | mteb | ✅ Mesuré |
| MTEB: MAEB Audio-Only | 50,2 % | 5ᵉ / 60 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Image-Text, Lite
MTEB: MVEB Video-Only
Notre analyse
Forces. Haon-Chen/e5-omni-7B se distingue surtout sur les évaluations multimodales de MTEB. Il figure parmi les meilleurs modèles sur MAEB pour les tâches audio et audio-texte, ainsi que sur Image-Text, Lite pour l’association multilingue entre images et textes. Ses résultats de premier plan sur MVEB et MVEB Video-Text renforcent son intérêt pour la recherche, la classification et le clustering reliant textes, vidéos et contenus audiovisuels. L’espace dense unique simplifie la comparaison entre modalités sans maintenir des représentations séparées. La licence MIT facilite par ailleurs l’auto-hébergement et l’intégration dans des systèmes propriétaires.
Limites et points d'attention. Le track MVEB Video-Only est moins favorable que ses évaluations audio, image-texte et vidéo-texte, avec un positionnement hors du groupe de tête. La dimension de 3 584 alourdit les index vectoriels et peut rendre le stockage, les transferts et la recherche plus coûteux que pour des embeddings plus compacts. Les 9 milliards de paramètres actifs impliquent aussi un modèle conséquent à exécuter. Usages pertinents : recherche sémantique multimodale, RAG fondé sur des corpus hétérogènes, rapprochement texte-média, similarité et clustering de contenus audio, visuels ou vidéo.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).