minishlab/potion-base-8M
Publié par minishlab le 29 octobre 2024 sous licence ouverte MIT, minishlab/potion-base-8M est un modèle d’embedding dense statique de 8 millions de paramètres, tous actifs. Il produit des vecteurs compacts de 256 dimensions à partir de textes.
Publié par minishlab le 29 octobre 2024 sous licence ouverte MIT, minishlab/potion-base-8M est un modèle d’embedding dense statique de 8 millions de paramètres, tous actifs. Il produit des vecteurs compacts de 256 dimensions à partir de textes.
Pré-entraîné avec Tokenlearn et distillé depuis baai/bge-base-en-v1.5, il vise la recherche sémantique, l’indexation pour le RAG, la mesure de similarité et le clustering. Ses représentations statiques peuvent être calculées sur CPU ou GPU, notamment pour des déploiements en temps réel ou disposant de ressources limitées.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | minishlab |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 29 octobre 2024 |
| Dimension du vecteur | 256 |
| Représentation | dense statique |
| Paramètres | 8 millions |
| Paramètres actifs | 8 millions |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 30,4 % | 160ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 32,6 % | 114ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 27,0 % | 162ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 13,8 % | 86ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 29,1 % | 85ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 27,5 % | 123ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 34,8 % | 118ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 39,1 % | 113ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 2,6 % | 189ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 16,1 % | 137ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 32,2 % | 89ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Dutch | 30,1 % | 98ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur résultat relatif du modèle apparaît sur MTEB European, consacré notamment aux langues européennes, au bitext mining et à la classification. Les évaluations Legal et Long-context Retrieval suivent, ce qui lui donne une base mesurable pour la recherche dans des corpus juridiques et des documents à contexte long, sans toutefois le placer parmi les références de ces catégories. Son principal atout est pratique : 8 millions de paramètres et des vecteurs de 256 dimensions permettent de construire des index compacts. La licence MIT facilite l’auto-hébergement et l’intégration commerciale. L’entraînement associe distillation, moyenne des sorties du Sentence Transformer, Tokenlearn, pondération par fréquence, PCA et pondération SIF.
Limites et points d’attention. Les classements MTEB restent bas sur l’ensemble des tracks rapportés. Les résultats sont particulièrement faibles sur BEIR, qui mesure la recherche zero-shot dans des domaines hétérogènes, ainsi que sur Dutch et Indic. Même ses meilleurs scores relatifs, European, Legal et Long-context Retrieval, se situent dans le bas de leurs classements respectifs. Avec près de deux ans d’ancienneté, durée très longue à l’échelle de l’IA, le modèle est probablement dépassé par des embeddings plus récents et peut avoir été retiré des catalogues actuels. Usages pertinents : prototypes légers, recherche sémantique locale, petits index RAG, similarité et clustering lorsque la sobriété des ressources prime sur la qualité de retrieval.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).