NeuML/pubmedbert-base-embeddings-500K
NeuML/pubmedbert-base-embeddings-500K est un modèle d’embedding dense publié par NeuML le 3 janvier 2025 sous licence ouverte Apache 2.0. Cette version statique et élaguée de PubMedBERT Embeddings 2M compte 1 million de paramètres actifs, conserve les 25 % de jetons les plus fréquents et…
NeuML/pubmedbert-base-embeddings-500K est un modèle d’embedding dense publié par NeuML le 3 janvier 2025 sous licence ouverte Apache 2.0. Cette version statique et élaguée de PubMedBERT Embeddings 2M compte 1 million de paramètres actifs, conserve les 25 % de jetons les plus fréquents et produit des vecteurs normalisés de 64 dimensions en précision int16.
Le modèle sert à encoder des textes biomédicaux, alimenter un index de recherche sémantique, mesurer des similarités, regrouper des contenus et constituer une source de connaissances pour un système RAG. Il s’intègre à txtai, Sentence-Transformers et Model2Vec.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | NeuML |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 3 janvier 2025 |
| Dimension du vecteur | 64 |
| Représentation | dense |
| Paramètres | 1 millions |
| Paramètres actifs | 1 millions |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Medical | 20,6 % | 141ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 2,1 % | 194ᵉ / 218 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Medical
MTEB: RTEB French
Notre analyse
Forces. L’intérêt de NeuML/pubmedbert-base-embeddings-500K réside surtout dans sa spécialisation biomédicale et dans son format compact. Ses vecteurs denses de 64 dimensions en int16 réduisent l’espace nécessaire au stockage des index et facilitent le déploiement de grandes bases d’embeddings. La normalisation simplifie les calculs de similarité. Sa licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. Son orientation vers PubMed en fait principalement un composant destiné à la recherche sémantique et au RAG sur des corpus médicaux ou biomédicaux.
Limites et points d'attention. Les résultats MTEB situent toutefois le modèle dans le bas du classement en Medical information retrieval, malgré sa spécialisation. Il est encore moins compétitif sur RTEB French, consacré à la recherche en français dans les domaines juridique et généraliste. L’élagage limité aux jetons les plus fréquents privilégie la compacité au détriment potentiel de la couverture lexicale, tandis que l’évaluation interne se concentre sur des jeux PubMed. Avec une ancienneté annoncée d’environ deux ans, très longue à l’échelle de l’IA, il appartient à une génération probablement dépassée et souvent retirée des catalogues actuels. Usages pertinents : prototypes et index compacts centrés sur PubMed, après validation sur le corpus cible.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).