nomic-ai/modernbert-embed-base
Publié par Nomic AI le 29 décembre 2024 sous licence ouverte Apache 2.0, nomic-ai/modernbert-embed-base est un modèle d’embedding dense de 149 millions de paramètres. Entraîné à partir de ModernBERT-base, il produit des vecteurs de 768 dimensions, avec une représentation Matryoshka…
Publié par Nomic AI le 29 décembre 2024 sous licence ouverte Apache 2.0, nomic-ai/modernbert-embed-base est un modèle d’embedding dense de 149 millions de paramètres. Entraîné à partir de ModernBERT-base, il produit des vecteurs de 768 dimensions, avec une représentation Matryoshka pouvant être tronquée à 256 dimensions.
Le modèle transforme les requêtes et documents en vecteurs destinés à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Il exige les préfixes « search_query: » et « search_document: » selon le type de texte, et s’intègre à Sentence Transformers, Transformers et Transformers.js.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Nomic AI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 29 décembre 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense avec représentation Matryoshka en 768 ou 256 dimensions |
| Paramètres | 149 millions |
| Paramètres actifs | 149 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 52,9 % | 66ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. Son résultat sur BEIR le place dans la moitié supérieure du classement pour la recherche zero-shot sur des tâches et domaines hétérogènes, sans atteindre le groupe de tête. La représentation Matryoshka constitue son principal atout pratique : les vecteurs complets de 768 dimensions privilégient la richesse de représentation, tandis que la troncature à 256 dimensions permet d’alléger les index et les calculs de similarité. La licence Apache 2.0 facilite l’intégration, la modification et l’auto-hébergement, y compris dans des applications commerciales.
Limites et points d'attention. Son rang sur BEIR indique une qualité de retrieval correcte mais déjà dépassée par de nombreux concurrents. Les vecteurs de 768 dimensions occupent davantage d’espace et rendent la recherche plus coûteuse que leur version tronquée, avec un possible compromis sur la précision. Âgé d’environ deux ans, ce modèle appartient à une génération ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et susceptible de ne plus figurer parmi les offres activement mises en avant par l’éditeur. Les préfixes d’instruction doivent être appliqués correctement pour distinguer requêtes et documents. Usages pertinents : moteurs de recherche sémantique, pipelines RAG, détection de similarité et clustering avec déploiement maîtrisé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).