minishlab/potion-base-2M
Publié par minishlab le 29 octobre 2024 sous licence ouverte MIT, minishlab/potion-base-2M est un modèle d’embedding dense statique de 2 millions de paramètres actifs. Il produit des vecteurs compacts de 64 dimensions et peut encoder du texte sur CPU comme sur GPU.
Publié par minishlab le 29 octobre 2024 sous licence ouverte MIT, minishlab/potion-base-2M est un modèle d’embedding dense statique de 2 millions de paramètres actifs. Il produit des vecteurs compacts de 64 dimensions et peut encoder du texte sur CPU comme sur GPU.
Ce modèle Model2Vec pré-entraîné avec Tokenlearn provient d’une distillation de baai/bge-base-en-v1.5. Son entraînement combine des embeddings moyens issus d’un vaste corpus, une pondération fréquentielle des tokens, une PCA et une pondération SIF. Il sert à la recherche sémantique, à l’indexation pour le RAG, à la mesure de similarité et au clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | minishlab |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 29 octobre 2024 |
| Dimension du vecteur | 64 |
| Représentation | dense statique |
| Paramètres | 2 millions |
| Paramètres actifs | 2 millions |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 22,9 % | 176ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 27,2 % | 135ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 21,6 % | 185ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 8,9 % | 92ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 23,1 % | 91ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 22,2 % | 136ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 29,4 % | 135ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 36,1 % | 118ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 1,3 % | 201ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 10,1 % | 175ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 31,4 % | 105ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Dutch | 26,2 % | 102ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Ses résultats MTEB les plus favorables concernent les langues européennes et indiennes, notamment des tâches mêlant bitext mining, classification et recherche. Cette orientation constitue son principal point d’intérêt relatif, même si ses rangs restent bas face aux autres modèles évalués. Ses 64 dimensions permettent de constituer des index plus légers et de réduire le volume de calcul associé à la comparaison des vecteurs. Avec seulement 2 millions de paramètres, une exécution sur CPU ou GPU et une licence MIT, le modèle se prête à un déploiement local dans des chaînes de recherche ou de RAG.
Limites et points d'attention. Les évaluations MTEB placent minishlab/potion-base-2M près du bas des classements sur l’ensemble des tracks fournis. Les faiblesses sont particulièrement marquées en finance avec RTEB Finance, ainsi qu’en néerlandais, en recherche juridique et en Long-context Retrieval. Sorti il y a environ deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et probablement dépassée par des embeddings plus récents. Usages pertinents : prototypes légers, index compacts, clustering exploratoire et recherche sémantique lorsque la sobriété prime sur la qualité maximale.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).