minishlab/potion-code-16M-v2

Publié par minishlab le 8 juillet 2026 sous licence ouverte MIT, minishlab/potion-code-16M-v2 est un modèle d’embedding dense statique de 16 millions de paramètres. Il produit des vecteurs compacts de 256 dimensions à partir de requêtes en langage naturel et de documents de code.

Publié par minishlab le 8 juillet 2026 sous licence ouverte MIT, minishlab/potion-code-16M-v2 est un modèle d’embedding dense statique de 16 millions de paramètres. Il produit des vecteurs compacts de 256 dimensions à partir de requêtes en langage naturel et de documents de code.

Le modèle est optimisé pour la recherche sémantique dans des corpus logiciels, le RAG appliqué au code, la mesure de similarité et le clustering. Distillé depuis nomic-ai/CodeRankEmbed, il a été entraîné sur CornStack avec Tokenlearn puis ajusté par apprentissage contrastif. Son corpus couvre Python, Java, JavaScript, Go, PHP et Ruby.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurminishlab
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie8 juillet 2026
Dimension du vecteur256
Représentationdense statique
Paramètres16 millions
Paramètres actifs16 millions
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Code Information Retrieval39,1 %45ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Code Information Retrieval

fyaronskiy/english_code…45 %
▶ minishlab/potion-code-1…39 %
MongoDB/mdbr-leaf-mt36 %

Notre analyse

Forces. Sa spécialisation associe des requêtes formulées en langage naturel à des documents de code, ce qui correspond directement aux besoins de recherche dans des dépôts logiciels et de récupération de contexte pour un système RAG. La couverture de six langages de programmation favorise les index réunissant plusieurs écosystèmes techniques. Avec 16 millions de paramètres et des vecteurs de 256 dimensions, le modèle offre une représentation compacte, susceptible d’alléger le stockage des index et les opérations de similarité. La licence MIT autorise par ailleurs l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d'attention. Sur MTEB Code Information Retrieval, minishlab/potion-code-16M-v2 se situe près du bas du classement, ce qui indique une efficacité comparative limitée sur la recherche de code couvrant divers langages et types de tâches. Cette mesure repose sur une seule source de données concordante et invite à valider les résultats sur les dépôts et les requêtes visés. Sa représentation statique privilégie la compacité plutôt qu’une forte capacité de représentation. Usages pertinents : recherche sémantique de code, RAG sur dépôts logiciels, détection de fragments similaires et clustering multilangage de contenus techniques.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).