NeuML/pubmedbert-base-embeddings-500K

NeuML/pubmedbert-base-embeddings-500K est un modèle d’embedding dense publié par NeuML le 3 janvier 2025 sous licence ouverte Apache 2.0. Cette version statique et élaguée de PubMedBERT Embeddings 2M compte 1 million de paramètres actifs, conserve les 25 % de jetons les plus fréquents et…

NeuML/pubmedbert-base-embeddings-500K est un modèle d’embedding dense publié par NeuML le 3 janvier 2025 sous licence ouverte Apache 2.0. Cette version statique et élaguée de PubMedBERT Embeddings 2M compte 1 million de paramètres actifs, conserve les 25 % de jetons les plus fréquents et produit des vecteurs normalisés de 64 dimensions en précision int16.

Le modèle sert à encoder des textes biomédicaux, alimenter un index de recherche sémantique, mesurer des similarités, regrouper des contenus et constituer une source de connaissances pour un système RAG. Il s’intègre à txtai, Sentence-Transformers et Model2Vec.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNeuML
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie3 janvier 2025
Dimension du vecteur64
Représentationdense
Paramètres1 millions
Paramètres actifs1 millions
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Medical20,6 %141ᵉ / 158mteb✅ Mesuré
MTEB: RTEB French2,1 %194ᵉ / 218mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Medical

▶ NeuML/pubmedbert-base-e…21 %
aari1995/German_Semanti…16 %

MTEB: RTEB French

voyageai/voyage-4-large…69 %
nvidia/Nemotron-3-Embed…65 %
▶ NeuML/pubmedbert-base-e…2 %

Notre analyse

Forces. L’intérêt de NeuML/pubmedbert-base-embeddings-500K réside surtout dans sa spécialisation biomédicale et dans son format compact. Ses vecteurs denses de 64 dimensions en int16 réduisent l’espace nécessaire au stockage des index et facilitent le déploiement de grandes bases d’embeddings. La normalisation simplifie les calculs de similarité. Sa licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. Son orientation vers PubMed en fait principalement un composant destiné à la recherche sémantique et au RAG sur des corpus médicaux ou biomédicaux.

Limites et points d'attention. Les résultats MTEB situent toutefois le modèle dans le bas du classement en Medical information retrieval, malgré sa spécialisation. Il est encore moins compétitif sur RTEB French, consacré à la recherche en français dans les domaines juridique et généraliste. L’élagage limité aux jetons les plus fréquents privilégie la compacité au détriment potentiel de la couverture lexicale, tandis que l’évaluation interne se concentre sur des jeux PubMed. Avec une ancienneté annoncée d’environ deux ans, très longue à l’échelle de l’IA, il appartient à une génération probablement dépassée et souvent retirée des catalogues actuels. Usages pertinents : prototypes et index compacts centrés sur PubMed, après validation sur le corpus cible.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).