NeuML/pubmedbert-base-embeddings-100K

NeuML/pubmedbert-base-embeddings-100K est un modèle d’embedding dense statique publié par NeuML le 3 janvier 2025 sous licence ouverte Apache 2.0. Version élaguée de PubMedBERT Embeddings 2M, il conserve les 5 % de jetons les plus fréquents du vocabulaire et produit des vecteurs…

NeuML/pubmedbert-base-embeddings-100K est un modèle d’embedding dense statique publié par NeuML le 3 janvier 2025 sous licence ouverte Apache 2.0. Version élaguée de PubMedBERT Embeddings 2M, il conserve les 5 % de jetons les plus fréquents du vocabulaire et produit des vecteurs normalisés de 64 dimensions, réduits par PCA et stockés en précision int16.

Sa représentation compacte vise la recherche sémantique, le rapprochement de textes, le clustering et l’apport de connaissances à un système RAG. Le modèle s’intègre à txtai, Sentence-Transformers et Model2Vec, notamment pour indexer des contenus biomédicaux proches des données PubMed utilisées lors de son évaluation.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNeuML
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie3 janvier 2025
Dimension du vecteur64
Représentationdense statique
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Medical12,5 %146ᵉ / 158mteb✅ Mesuré
MTEB: RTEB French2,3 %192ᵉ / 218mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Medical

Jaume/gemma-2b-embeddin…16 %
▶ NeuML/pubmedbert-base-e…13 %

MTEB: RTEB French

voyageai/voyage-4-large…69 %
nvidia/Nemotron-3-Embed…65 %
▶ NeuML/pubmedbert-base-e…2 %

Notre analyse

Forces. L’intérêt de NeuML/pubmedbert-base-embeddings-100K réside surtout dans sa spécialisation biomédicale et dans son faible encombrement. Ses vecteurs de 64 dimensions en int16 permettent de constituer des index plus légers que des représentations de grande dimension, ce qui facilite le stockage et les calculs de similarité. La normalisation des embeddings convient directement à la recherche sémantique et au clustering. La licence Apache 2.0 autorise par ailleurs l’auto-hébergement et l’intégration dans des applications. Son évaluation sur PubMed l’oriente vers le rapprochement de textes médicaux et biomédicaux, même si MTEB Medical ne le place pas parmi les modèles les plus performants.

Limites et points d'attention. Les résultats MTEB sont faibles sur les deux axes mesurés. Le modèle figure près du bas du classement en recherche d’information médicale et obtient également un positionnement défavorable sur RTEB French, qui couvre la recherche en français dans les domaines juridique et généraliste. L’élagage du vocabulaire et la réduction à 64 dimensions privilégient la compacité, avec une perte potentielle de finesse sémantique par rapport à la version 2M. À près de deux ans, il est très ancien à l’échelle de l’IA, probablement dépassé par des modèles de sa période et susceptible d’avoir été retiré du catalogue de l’éditeur. Usages pertinents : index biomédicaux compacts, prototypes RAG sur PubMed, similarité et clustering lorsque la légèreté prime sur la qualité de retrieval.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).