minishlab/potion-multilingual-128M

Publié par minishlab le 23 mai 2025 sous licence ouverte MIT, minishlab/potion-multilingual-128M est un modèle d’embedding statique de 128 millions de paramètres actifs. Entraîné sur 101 langues, il produit des vecteurs compacts de 256 dimensions.

Publié par minishlab le 23 mai 2025 sous licence ouverte MIT, minishlab/potion-multilingual-128M est un modèle d’embedding statique de 128 millions de paramètres actifs. Entraîné sur 101 langues, il produit des vecteurs compacts de 256 dimensions.

Ce modèle Model2Vec a été pré-entraîné avec Tokenlearn sur les langues de C4, puis distillé depuis BAAI/bge-m3. Il transforme les textes en représentations numériques destinées à la recherche sémantique, à la sélection de passages pour le RAG, au calcul de similarité et au clustering. Son exécution passe par la bibliothèque model2vec, avec StaticModel.from_pretrained puis encode.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurminishlab
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie23 mai 2025
Dimension du vecteur256
Représentationembeddings statiques de texte (256 dimensions)
Paramètres128 millions
Paramètres actifs128 millions
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR-NL20,2 %15ᵉ / 16mteb✅ Mesuré
MTEB: Long-context Retrieval26,7 %137ᵉ / 170mteb✅ Mesuré
MTEB: Reasoning Retrieval6,2 %28ᵉ / 29mteb✅ Mesuré
MTEB: RTEB English22,0 %5ᵉ / 5mteb✅ Mesuré
MTEB: RTEB Code18,0 %4ᵉ / 5mteb✅ Mesuré
MTEB: Code Information Retrieval27,7 %49ᵉ / 49mteb✅ Mesuré
MTEB: Code29,6 %43ᵉ / 43mteb✅ Mesuré
MTEB: RTEB Legal29,4 %145ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare14,9 %85ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance27,3 %86ᵉ / 97mteb✅ Mesuré
MTEB: Medical27,8 %121ᵉ / 158mteb✅ Mesuré
MTEB: Legal37,9 %96ᵉ / 157mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR-NL

▶ minishlab/potion-multil…20 %

MTEB: Long-context Retrieval

bigscience/sgpt-bloom-7…29 %
▶ minishlab/potion-multil…27 %

Notre analyse

Forces. Son principal intérêt réside dans sa couverture multilingue et dans un positionnement relativement plus favorable sur le track MTEB Indic, où il se situe dans la première moitié du classement. Les résultats European et Dutch le placent plutôt en milieu de tableau, ce qui permet d’envisager des traitements sémantiques couvrant plusieurs langues. Les vecteurs de 256 dimensions réduisent la taille des index et le coût de la recherche par rapport à des représentations plus larges. La licence MIT facilite par ailleurs l’auto-hébergement, l’adaptation et l’intégration dans des systèmes commerciaux.

Limites et points d'attention. Les évaluations MTEB montrent un positionnement faible sur Chemical, Spanish et surtout Chinese, avec des rangs proches du bas de leurs classements respectifs. La vocation multilingue ne garantit donc pas une qualité homogène selon la langue ou le domaine. Sorti il y a environ un an, un âge déjà long à l’échelle de l’IA, le modèle appartient à une génération probablement dépassée par des embeddings multilingues plus récents et souvent absente des catalogues actuels. Usages pertinents : index multilingues compacts, recherche sémantique généraliste, clustering et récupération de passages pour un pipeline RAG, après validation sur les langues ciblées.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).