minishlab/potion-multilingual-128M
Publié par minishlab le 23 mai 2025 sous licence ouverte MIT, minishlab/potion-multilingual-128M est un modèle d’embedding statique de 128 millions de paramètres actifs. Entraîné sur 101 langues, il produit des vecteurs compacts de 256 dimensions.
Publié par minishlab le 23 mai 2025 sous licence ouverte MIT, minishlab/potion-multilingual-128M est un modèle d’embedding statique de 128 millions de paramètres actifs. Entraîné sur 101 langues, il produit des vecteurs compacts de 256 dimensions.
Ce modèle Model2Vec a été pré-entraîné avec Tokenlearn sur les langues de C4, puis distillé depuis BAAI/bge-m3. Il transforme les textes en représentations numériques destinées à la recherche sémantique, à la sélection de passages pour le RAG, au calcul de similarité et au clustering. Son exécution passe par la bibliothèque model2vec, avec StaticModel.from_pretrained puis encode.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | minishlab |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 23 mai 2025 |
| Dimension du vecteur | 256 |
| Représentation | embeddings statiques de texte (256 dimensions) |
| Paramètres | 128 millions |
| Paramètres actifs | 128 millions |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR-NL | 20,2 % | 15ᵉ / 16 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 26,7 % | 137ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 6,2 % | 28ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: RTEB English | 22,0 % | 5ᵉ / 5 | mteb | ✅ Mesuré |
| MTEB: RTEB Code | 18,0 % | 4ᵉ / 5 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 27,7 % | 49ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 29,6 % | 43ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 29,4 % | 145ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 14,9 % | 85ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 27,3 % | 86ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 27,8 % | 121ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 37,9 % | 96ᵉ / 157 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR-NL
MTEB: Long-context Retrieval
Notre analyse
Forces. Son principal intérêt réside dans sa couverture multilingue et dans un positionnement relativement plus favorable sur le track MTEB Indic, où il se situe dans la première moitié du classement. Les résultats European et Dutch le placent plutôt en milieu de tableau, ce qui permet d’envisager des traitements sémantiques couvrant plusieurs langues. Les vecteurs de 256 dimensions réduisent la taille des index et le coût de la recherche par rapport à des représentations plus larges. La licence MIT facilite par ailleurs l’auto-hébergement, l’adaptation et l’intégration dans des systèmes commerciaux.
Limites et points d'attention. Les évaluations MTEB montrent un positionnement faible sur Chemical, Spanish et surtout Chinese, avec des rangs proches du bas de leurs classements respectifs. La vocation multilingue ne garantit donc pas une qualité homogène selon la langue ou le domaine. Sorti il y a environ un an, un âge déjà long à l’échelle de l’IA, le modèle appartient à une génération probablement dépassée par des embeddings multilingues plus récents et souvent absente des catalogues actuels. Usages pertinents : index multilingues compacts, recherche sémantique généraliste, clustering et récupération de passages pour un pipeline RAG, après validation sur les langues ciblées.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).