minishlab/potion-base-8M

Publié par minishlab le 29 octobre 2024 sous licence ouverte MIT, minishlab/potion-base-8M est un modèle d’embedding dense statique de 8 millions de paramètres, tous actifs. Il produit des vecteurs compacts de 256 dimensions à partir de textes.

Publié par minishlab le 29 octobre 2024 sous licence ouverte MIT, minishlab/potion-base-8M est un modèle d’embedding dense statique de 8 millions de paramètres, tous actifs. Il produit des vecteurs compacts de 256 dimensions à partir de textes.

Pré-entraîné avec Tokenlearn et distillé depuis baai/bge-base-en-v1.5, il vise la recherche sémantique, l’indexation pour le RAG, la mesure de similarité et le clustering. Ses représentations statiques peuvent être calculées sur CPU ou GPU, notamment pour des déploiements en temps réel ou disposant de ressources limitées.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurminishlab
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie29 octobre 2024
Dimension du vecteur256
Représentationdense statique
Paramètres8 millions
Paramètres actifs8 millions
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR30,4 %160ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval32,6 %114ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal27,0 %162ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare13,8 %86ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance29,1 %85ᵉ / 97mteb✅ Mesuré
MTEB: Medical27,5 %123ᵉ / 158mteb✅ Mesuré
MTEB: Legal34,8 %118ᵉ / 157mteb✅ Mesuré
MTEB: European39,1 %113ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French2,6 %189ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German16,1 %137ᵉ / 209mteb✅ Mesuré
MTEB: Indic32,2 %89ᵉ / 119mteb✅ Mesuré
MTEB: Dutch30,1 %98ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur résultat relatif du modèle apparaît sur MTEB European, consacré notamment aux langues européennes, au bitext mining et à la classification. Les évaluations Legal et Long-context Retrieval suivent, ce qui lui donne une base mesurable pour la recherche dans des corpus juridiques et des documents à contexte long, sans toutefois le placer parmi les références de ces catégories. Son principal atout est pratique : 8 millions de paramètres et des vecteurs de 256 dimensions permettent de construire des index compacts. La licence MIT facilite l’auto-hébergement et l’intégration commerciale. L’entraînement associe distillation, moyenne des sorties du Sentence Transformer, Tokenlearn, pondération par fréquence, PCA et pondération SIF.

Limites et points d’attention. Les classements MTEB restent bas sur l’ensemble des tracks rapportés. Les résultats sont particulièrement faibles sur BEIR, qui mesure la recherche zero-shot dans des domaines hétérogènes, ainsi que sur Dutch et Indic. Même ses meilleurs scores relatifs, European, Legal et Long-context Retrieval, se situent dans le bas de leurs classements respectifs. Avec près de deux ans d’ancienneté, durée très longue à l’échelle de l’IA, le modèle est probablement dépassé par des embeddings plus récents et peut avoir été retiré des catalogues actuels. Usages pertinents : prototypes légers, recherche sémantique locale, petits index RAG, similarité et clustering lorsque la sobriété des ressources prime sur la qualité de retrieval.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).