mixedbread-ai/mxbai-embed-2d-large-v1

Publié par Mixedbread AI le 4 mars 2024, mixedbread-ai/mxbai-embed-2d-large-v1 est un modèle d'embedding dense de 335 millions de paramètres, tous actifs. Il représente chaque texte par un vecteur de 768 dimensions.

Publié par Mixedbread AI le 4 mars 2024, mixedbread-ai/mxbai-embed-2d-large-v1 est un modèle d'embedding dense de 335 millions de paramètres, tous actifs. Il représente chaque texte par un vecteur de 768 dimensions.

Le modèle sert à indexer et rapprocher des contenus selon leur sens, notamment pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité et le clustering. Sa licence ouverte Apache 2.0 autorise des usages commerciaux ainsi que la modification et la redistribution.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMixedbread AI
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie4 mars 2024
Dimension du vecteur768
Représentationdense
Paramètres335 millions
Paramètres actifs335 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR51,4 %85ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. mixedbread-ai/mxbai-embed-2d-large-v1 est spécifiquement adapté à la représentation vectorielle dense de textes. Son évaluation sur BEIR porte sur la recherche zero-shot à travers des tâches et domaines hétérogènes, ce qui correspond directement aux besoins de retrieval sans adaptation propre à chaque corpus. La sortie fixe de 768 dimensions facilite son intégration dans des index vectoriels, tandis que la licence Apache 2.0 constitue un atout pour le déploiement, l'adaptation et l'exploitation commerciale.

Limites et points d'attention. Sur BEIR, le modèle se situe dans la moitié supérieure du classement, mais loin des premières places, ce qui indique une qualité de recherche correcte plutôt qu'une position de référence. Ses 335 millions de paramètres actifs impliquent aussi un modèle plus substantiel que des encodeurs très légers. Sorti il y a environ deux ans, il est très ancien à l'échelle de l'IA et probablement dépassé par des modèles plus récents de sa catégorie, voire retiré du catalogue courant de son éditeur. Usages pertinents : recherche sémantique, retrieval pour RAG, similarité textuelle et clustering lorsque l'ouverture de la licence et une représentation dense de 768 dimensions sont recherchées.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).