minishlab/potion-base-4M
Publié par minishlab le 29 octobre 2024 sous licence ouverte MIT, minishlab/potion-base-4M est un modèle d’embedding de 4 millions de paramètres actifs. Il produit des vecteurs denses statiques de 128 dimensions, un format compact qui limite la taille des index.
Publié par minishlab le 29 octobre 2024 sous licence ouverte MIT, minishlab/potion-base-4M est un modèle d’embedding de 4 millions de paramètres actifs. Il produit des vecteurs denses statiques de 128 dimensions, un format compact qui limite la taille des index.
Cette version Model2Vec, pré-entraînée avec Tokenlearn, est issue d’une distillation de baai/bge-base-en-v1.5. Elle sert à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité et au clustering. Les embeddings peuvent être calculés sur CPU comme sur GPU.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | minishlab |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 29 octobre 2024 |
| Dimension du vecteur | 128 |
| Représentation | dense statique |
| Paramètres | 4 millions |
| Paramètres actifs | 4 millions |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 27,9 % | 166ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 31,2 % | 118ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 24,9 % | 174ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 12,0 % | 89ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 26,4 % | 88ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 25,8 % | 126ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 32,9 % | 125ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 38,1 % | 114ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 2,0 % | 196ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 13,1 % | 158ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 32,0 % | 94ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Dutch | 28,8 % | 100ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur résultat relatif du modèle apparaît sur MTEB European, qui couvre notamment le bitext mining et la classification dans plusieurs langues européennes. Sa qualité reste toutefois modeste au regard du classement. Les 128 dimensions rendent les vecteurs compacts, ce qui allège le stockage des index et les opérations de recherche. La licence MIT facilite l’auto-hébergement et l’intégration commerciale. La création du modèle combine distillation, apprentissage sur des embeddings moyens issus d’un grand corpus, pondération selon la fréquence des tokens, PCA et pondération SIF.
Limites et points d’attention. Les classements sont faibles sur tous les tracks rapportés. Les résultats sont particulièrement en retrait sur BEIR, consacré à la recherche zero-shot dans des domaines variés, ainsi que sur MTEB Dutch. Les évaluations Legal, Indic et Long-context Retrieval placent également le modèle dans le bas de leurs classements respectifs. Sorti en 2024, il appartient désormais à une génération ancienne à l’échelle rapide de l’IA et peut être dépassé par des solutions plus récentes. Usages pertinents : index compacts, recherche sémantique légère, clustering et prototypes RAG sur CPU ou GPU lorsque la simplicité prime sur la qualité maximale de récupération.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).