NeuML/pubmedbert-base-embeddings-8M

NeuML/pubmedbert-base-embeddings-8M est un modèle d’embedding dense statique publié par NeuML le 3 janvier 2025. Cette version distillée de PubMedBERT compte 8 millions de paramètres actifs et produit des vecteurs de 256 dimensions, un format compact adapté à la création d’index…

NeuML/pubmedbert-base-embeddings-8M est un modèle d’embedding dense statique publié par NeuML le 3 janvier 2025. Cette version distillée de PubMedBERT compte 8 millions de paramètres actifs et produit des vecteurs de 256 dimensions, un format compact adapté à la création d’index vectoriels légers.

Distribué sous licence ouverte Apache 2.0, le modèle peut être auto-hébergé et exécuté uniquement sur CPU. Il transforme des textes, notamment du domaine PubMed, en représentations numériques destinées à la recherche sémantique, à l’apport de connaissances dans un système RAG, au calcul de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNeuML
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie3 janvier 2025
Dimension du vecteur256
Représentationdense statique
Paramètres8 millions
Paramètres actifs8 millions
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Medical27,6 %122ᵉ / 158mteb✅ Mesuré
MTEB: RTEB French3,6 %183ᵉ / 218mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Medical

▶ NeuML/pubmedbert-base-e…28 %
omarelshehy/arabic-engl…26 %

MTEB: RTEB French

voyageai/voyage-4-large…69 %
nvidia/Nemotron-3-Embed…65 %
▶ NeuML/pubmedbert-base-e…4 %

Notre analyse

Forces. Son principal axe d’intérêt est la recherche d’information médicale, biomédicale, clinique et liée à la santé grand public, même si son classement MTEB Medical reste modeste. Sa petite taille et ses vecteurs de 256 dimensions réduisent l’espace requis par les index et facilitent un déploiement sur CPU. Entraîné avec Tokenlearn, il utilise Model2Vec et des embeddings statiques. Les représentations finales sont pondérées avec BM25, transformées par PCA puis normalisées. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration avec txtai, Sentence-Transformers ou Model2Vec.

Limites et points d'attention. Les résultats MTEB situent le modèle dans le bas du classement en recherche médicale, et plus nettement encore sur RTEB French, consacré à la recherche en français dans les domaines juridique et généraliste. Il paraît donc peu adapté aux corpus francophones exigeants. Avec environ deux ans d’ancienneté, une durée très longue à l’échelle de l’IA, il est probablement dépassé par des embeddings plus récents et peut ne plus figurer dans les catalogues actuels. Usages pertinents : prototypes compacts sur CPU, index PubMed légers, recherche sémantique spécialisée et composant de récupération pour un RAG médical.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).