minishlab/potion-base-2M

Publié par minishlab le 29 octobre 2024 sous licence ouverte MIT, minishlab/potion-base-2M est un modèle d’embedding dense statique de 2 millions de paramètres actifs. Il produit des vecteurs compacts de 64 dimensions et peut encoder du texte sur CPU comme sur GPU.

Publié par minishlab le 29 octobre 2024 sous licence ouverte MIT, minishlab/potion-base-2M est un modèle d’embedding dense statique de 2 millions de paramètres actifs. Il produit des vecteurs compacts de 64 dimensions et peut encoder du texte sur CPU comme sur GPU.

Ce modèle Model2Vec pré-entraîné avec Tokenlearn provient d’une distillation de baai/bge-base-en-v1.5. Son entraînement combine des embeddings moyens issus d’un vaste corpus, une pondération fréquentielle des tokens, une PCA et une pondération SIF. Il sert à la recherche sémantique, à l’indexation pour le RAG, à la mesure de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurminishlab
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie29 octobre 2024
Dimension du vecteur64
Représentationdense statique
Paramètres2 millions
Paramètres actifs2 millions
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR22,9 %176ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval27,2 %135ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal21,6 %185ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare8,9 %92ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance23,1 %91ᵉ / 97mteb✅ Mesuré
MTEB: Medical22,2 %136ᵉ / 158mteb✅ Mesuré
MTEB: Legal29,4 %135ᵉ / 157mteb✅ Mesuré
MTEB: European36,1 %118ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French1,3 %201ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German10,1 %175ᵉ / 209mteb✅ Mesuré
MTEB: Indic31,4 %105ᵉ / 119mteb✅ Mesuré
MTEB: Dutch26,2 %102ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ minishlab/potion-base-2M23 %
aari1995/German_Semanti…18 %

MTEB: Long-context Retrieval

bigscience/sgpt-bloom-7…29 %
▶ minishlab/potion-base-2M27 %

Notre analyse

Forces. Ses résultats MTEB les plus favorables concernent les langues européennes et indiennes, notamment des tâches mêlant bitext mining, classification et recherche. Cette orientation constitue son principal point d’intérêt relatif, même si ses rangs restent bas face aux autres modèles évalués. Ses 64 dimensions permettent de constituer des index plus légers et de réduire le volume de calcul associé à la comparaison des vecteurs. Avec seulement 2 millions de paramètres, une exécution sur CPU ou GPU et une licence MIT, le modèle se prête à un déploiement local dans des chaînes de recherche ou de RAG.

Limites et points d'attention. Les évaluations MTEB placent minishlab/potion-base-2M près du bas des classements sur l’ensemble des tracks fournis. Les faiblesses sont particulièrement marquées en finance avec RTEB Finance, ainsi qu’en néerlandais, en recherche juridique et en Long-context Retrieval. Sorti il y a environ deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et probablement dépassée par des embeddings plus récents. Usages pertinents : prototypes légers, index compacts, clustering exploratoire et recherche sémantique lorsque la sobriété prime sur la qualité maximale.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).