NeuML/pubmedbert-base-embeddings-2M

NeuML/pubmedbert-base-embeddings-2M est un modèle d’embedding médical publié par NeuML le 3 janvier 2025 sous licence ouverte Apache 2.0. Cette version distillée de PubMedBERT compte 2 millions de paramètres actifs et produit des vecteurs denses statiques de 64 dimensions.

NeuML/pubmedbert-base-embeddings-2M est un modèle d’embedding médical publié par NeuML le 3 janvier 2025 sous licence ouverte Apache 2.0. Cette version distillée de PubMedBERT compte 2 millions de paramètres actifs et produit des vecteurs denses statiques de 64 dimensions.

Le modèle transforme des textes en représentations numériques compactes pour la recherche sémantique, la création d’index, le RAG, la mesure de similarité et le clustering. Ses embeddings statiques sont pondérés avec BM25 puis normalisés. Le calcul fonctionne sur CPU ou GPU, avec une intégration possible dans txtai, Sentence-Transformers et Model2Vec.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNeuML
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie3 janvier 2025
Dimension du vecteur64
Représentationdense statique
Paramètres2 millions
Paramètres actifs2 millions
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Medical23,6 %132ᵉ / 158mteb✅ Mesuré
MTEB: RTEB French2,3 %190ᵉ / 218mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Medical

omarelshehy/arabic-engl…26 %
▶ NeuML/pubmedbert-base-e…24 %
consciousAI/cai-lunaris…23 %

MTEB: RTEB French

voyageai/voyage-4-large…69 %
nvidia/Nemotron-3-Embed…65 %
▶ NeuML/pubmedbert-base-e…2 %

Notre analyse

Forces. Son orientation biomédicale et clinique le destine principalement à la recherche d’information médicale. Parmi les deux évaluations MTEB disponibles, Medical constitue son domaine le moins faible, sans toutefois le placer parmi les modèles les plus performants. La dimension de sortie limitée à 64 rend les index plus compacts et réduit les besoins de stockage par rapport à des représentations plus larges. Avec seulement 2 millions de paramètres actifs, des embeddings statiques et une exécution sur CPU ou GPU, le modèle privilégie un déploiement léger. La licence Apache 2.0 autorise également l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d’attention. Les résultats MTEB restent faibles en recherche médicale, avec un classement situé dans le bas du tableau. RTEB French est encore moins favorable, ce qui rend le modèle peu adapté à la recherche en français dans les domaines juridique et généraliste. Sa représentation statique compacte favorise l’efficacité, mais limite la richesse sémantique portée par chaque vecteur. Son ancienneté d’environ deux ans est très longue à l’échelle de l’IA, ce qui le rattache à une génération probablement dépassée par des modèles plus récents et souvent retirée des catalogues actifs. Usages pertinents : prototypes légers de recherche biomédicale, index compacts, bases d’embeddings et pipelines RAG à ressources limitées.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).