minishlab/potion-base-4M

Publié par minishlab le 29 octobre 2024 sous licence ouverte MIT, minishlab/potion-base-4M est un modèle d’embedding de 4 millions de paramètres actifs. Il produit des vecteurs denses statiques de 128 dimensions, un format compact qui limite la taille des index.

Publié par minishlab le 29 octobre 2024 sous licence ouverte MIT, minishlab/potion-base-4M est un modèle d’embedding de 4 millions de paramètres actifs. Il produit des vecteurs denses statiques de 128 dimensions, un format compact qui limite la taille des index.

Cette version Model2Vec, pré-entraînée avec Tokenlearn, est issue d’une distillation de baai/bge-base-en-v1.5. Elle sert à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité et au clustering. Les embeddings peuvent être calculés sur CPU comme sur GPU.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurminishlab
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie29 octobre 2024
Dimension du vecteur128
Représentationdense statique
Paramètres4 millions
Paramètres actifs4 millions
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR27,9 %166ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval31,2 %118ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal24,9 %174ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare12,0 %89ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance26,4 %88ᵉ / 97mteb✅ Mesuré
MTEB: Medical25,8 %126ᵉ / 158mteb✅ Mesuré
MTEB: Legal32,9 %125ᵉ / 157mteb✅ Mesuré
MTEB: European38,1 %114ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French2,0 %196ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German13,1 %158ᵉ / 209mteb✅ Mesuré
MTEB: Indic32,0 %94ᵉ / 119mteb✅ Mesuré
MTEB: Dutch28,8 %100ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur résultat relatif du modèle apparaît sur MTEB European, qui couvre notamment le bitext mining et la classification dans plusieurs langues européennes. Sa qualité reste toutefois modeste au regard du classement. Les 128 dimensions rendent les vecteurs compacts, ce qui allège le stockage des index et les opérations de recherche. La licence MIT facilite l’auto-hébergement et l’intégration commerciale. La création du modèle combine distillation, apprentissage sur des embeddings moyens issus d’un grand corpus, pondération selon la fréquence des tokens, PCA et pondération SIF.

Limites et points d’attention. Les classements sont faibles sur tous les tracks rapportés. Les résultats sont particulièrement en retrait sur BEIR, consacré à la recherche zero-shot dans des domaines variés, ainsi que sur MTEB Dutch. Les évaluations Legal, Indic et Long-context Retrieval placent également le modèle dans le bas de leurs classements respectifs. Sorti en 2024, il appartient désormais à une génération ancienne à l’échelle rapide de l’IA et peut être dépassé par des solutions plus récentes. Usages pertinents : index compacts, recherche sémantique légère, clustering et prototypes RAG sur CPU ou GPU lorsque la simplicité prime sur la qualité maximale de récupération.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).