NeuML/pubmedbert-base-embeddings-1M

Publié par NeuML le 3 janvier 2025 sous licence ouverte Apache 2.0, NeuML/pubmedbert-base-embeddings-1M est un modèle d’embedding dense de 1 million de paramètres, tous actifs. Version élaguée de PubMedBERT Embeddings 2M, il conserve les jetons les plus fréquents et produit des vecteurs…

Publié par NeuML le 3 janvier 2025 sous licence ouverte Apache 2.0, NeuML/pubmedbert-base-embeddings-1M est un modèle d’embedding dense de 1 million de paramètres, tous actifs. Version élaguée de PubMedBERT Embeddings 2M, il conserve les jetons les plus fréquents et produit des vecteurs compacts de 64 dimensions par ACP.

Le modèle repondère les jetons, normalise les embeddings et stocke les vecteurs en précision int16. Compatible avec txtai, Sentence-Transformers et Model2Vec, il sert à encoder des textes, construire un index de recherche sémantique, alimenter la récupération d’un système RAG et regrouper des contenus par similarité.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNeuML
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie3 janvier 2025
Dimension du vecteur64
Représentationdense
Paramètres1 millions
Paramètres actifs1 millions
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Medical23,2 %134ᵉ / 158mteb✅ Mesuré
MTEB: RTEB French2,0 %195ᵉ / 218mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Medical

consciousAI/cai-lunaris…23 %
▶ NeuML/pubmedbert-base-e…23 %

MTEB: RTEB French

voyageai/voyage-4-large…69 %
nvidia/Nemotron-3-Embed…65 %
▶ NeuML/pubmedbert-base-e…2 %

Notre analyse

Forces. Son orientation biomédicale constitue son principal axe fonctionnel, avec un résultat MTEB Medical supérieur à celui obtenu sur RTEB French, même si son classement reste bas sur ce track médical. La représentation dense de 64 dimensions et le stockage en int16 favorisent des index compacts, avec une empreinte plus faible pour la conservation et la consultation des vecteurs. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. Son million de paramètres facilite également le déploiement d’un encodeur statique léger.

Limites et points d'attention. Les classements MTEB placent le modèle dans le bas du tableau en recherche d’information médicale et encore plus bas sur RTEB French, consacré à la recherche en français dans les domaines juridique et généraliste. Sa forte compression, fondée sur l’élagage de 50 % des jetons et une ACP à 64 dimensions, privilégie la compacité au prix d’une représentation potentiellement moins riche. Avec près de deux ans d’ancienneté, durée très longue à l’échelle de l’IA, il appartient à une génération probablement dépassée et souvent retirée des catalogues actuels. Usages pertinents : prototypes biomédicaux légers, index sémantiques compacts, clustering et récupération RAG lorsque la sobriété prime sur la qualité de recherche.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).