mixedbread-ai/mxbai-embed-large-v1
Publié par Mixedbread AI le 7 mars 2024, mixedbread-ai/mxbai-embed-large-v1 est un modèle d’embedding dense de 335 millions de paramètres, tous actifs. Chaque texte est représenté par un vecteur de 1 024 dimensions. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement et…
Publié par Mixedbread AI le 7 mars 2024, mixedbread-ai/mxbai-embed-large-v1 est un modèle d’embedding dense de 335 millions de paramètres, tous actifs. Chaque texte est représenté par un vecteur de 1 024 dimensions. Sa licence ouverte Apache 2.0 autorise notamment l’auto-hébergement et l’intégration dans des systèmes propriétaires.
Le modèle sert à indexer et comparer des contenus pour la recherche sémantique, la récupération documentaire d’un système RAG, la mesure de similarité ou le clustering. Ses évaluations couvrent notamment l’anglais, le français et plusieurs langues européennes, ainsi que des corpus financiers et médicaux.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Mixedbread AI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 7 mars 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 335 millions |
| Paramètres actifs | 335 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 54,3 % | 51ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 38,9 % | 81ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 31,6 % | 131ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 46,9 % | 55ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 57,4 % | 53ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 41,2 % | 63ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 39,9 % | 80ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 49,3 % | 57ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 27,2 % | 104ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 16,4 % | 133ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 53,1 % | 43ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Scandinavian | 45,3 % | 39ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent RTEB Finance et BEIR. Le modèle montre ainsi son principal intérêt dans la recherche documentaire, y compris en zero-shot sur des tâches et domaines hétérogènes, avec une aptitude notable sur les contenus financiers. Le track French le place dans la première moitié du classement correspondant, ce qui soutient son emploi pour la classification, le clustering et la comparaison de textes en français. La licence Apache 2.0 constitue un atout pratique pour déployer localement le modèle et adapter son infrastructure d’indexation.
Limites et points d’attention. Les résultats sont plus modestes sur RTEB Healthcare et European, tandis que Scandinavian figure près du bas de son classement. La représentation dense en 1 024 dimensions implique des index plus lourds et davantage de calcul lors des recherches qu’avec des vecteurs moins dimensionnés. Sorti il y a environ deux ans, un âge très long à l’échelle de l’IA, le modèle est probablement dépassé par des embeddings plus récents et peut avoir quitté certains catalogues. Usages pertinents : recherche sémantique généraliste ou financière, RAG, similarité et clustering en français, après validation sur le corpus cible.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).