mixedbread-ai/mxbai-embed-xsmall-v1
Publié par Mixedbread AI le 13 août 2024, mixedbread-ai/mxbai-embed-xsmall-v1 est un modèle d’embedding dense de 24 millions de paramètres, tous actifs. Il encode les textes sous forme de vecteurs de 384 dimensions, un format compact adapté à la constitution d’index.
Publié par Mixedbread AI le 13 août 2024, mixedbread-ai/mxbai-embed-xsmall-v1 est un modèle d’embedding dense de 24 millions de paramètres, tous actifs. Il encode les textes sous forme de vecteurs de 384 dimensions, un format compact adapté à la constitution d’index.
Le modèle sert à la recherche sémantique, à la récupération de passages pour un système RAG, au calcul de similarité et au clustering. Il ne génère pas de texte. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement et l’intégration dans des applications commerciales.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Mixedbread AI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 13 août 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 24 millions |
| Paramètres actifs | 24 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 42,8 % | 134ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. Sa principale qualité pratique réside dans son format réduit. Avec 24 millions de paramètres et des vecteurs denses de 384 dimensions, il permet de construire des index plus légers que des modèles produisant des représentations plus grandes. Son évaluation sur BEIR confirme son orientation vers le zero-shot retrieval sur des tâches et domaines hétérogènes. La licence Apache 2.0 facilite l’auto-hébergement, la modification et l’intégration commerciale.
Limites et points d’attention. Son classement dans la partie basse de BEIR indique une qualité de recherche relativement limitée face à la majorité des modèles évalués sur ce benchmark. Sorti il y a environ deux ans, il est très ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents, tandis que les références de cette période sont souvent retirées des catalogues des éditeurs. Son intérêt tient donc davantage à sa compacité et à sa licence qu’à des performances de premier plan. Usages pertinents : indexation légère, recherche sémantique simple, RAG peu exigeant, similarité de textes et clustering sous contraintes de ressources.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).