nomic-ai/nomic-embed-text-v1.5
Publié par Nomic AI le 10 février 2024 sous licence ouverte Apache 2.0, nomic-ai/nomic-embed-text-v1.5 est un modèle d’embedding dense de 137 millions de paramètres. Issu d’un BERT à contexte long, il produit par défaut des vecteurs de 768 dimensions et couvre notamment des évaluations…
Publié par Nomic AI le 10 février 2024 sous licence ouverte Apache 2.0, nomic-ai/nomic-embed-text-v1.5 est un modèle d’embedding dense de 137 millions de paramètres. Issu d’un BERT à contexte long, il produit par défaut des vecteurs de 768 dimensions et couvre notamment des évaluations en anglais, français, espagnol et autres langues européennes.
Il transforme les textes en vecteurs destinés à la recherche sémantique, au RAG, au clustering et à la classification. Chaque entrée requiert un préfixe correspondant à la tâche, comme search_document, search_query, clustering ou classification. Matryoshka Representation Learning permet aussi d’utiliser des représentations réduites à 512, 256, 128 ou 64 dimensions.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Nomic AI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 10 février 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense uniquement |
| Paramètres | 137 millions |
| Paramètres actifs | 137 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 51,8 % | 77ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 30,6 % | 124ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 26,5 % | 165ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 37,3 % | 94ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 35,8 % | 108ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 46,3 % | 84ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 18,5 % | 135ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 9,0 % | 180ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 71,8 % | 12ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: Spanish | 48,9 % | 25ᵉ / 27 | mteb | ✅ Mesuré |
| MTEB: French | 45,6 % | 84ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Indic | 35,6 % | 65ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Son meilleur positionnement MTEB concerne les textes du domaine Chemical, où il se classe dans le premier tiers. Sur BEIR, ses résultats traduisent une aptitude plus générale à la recherche zero-shot dans des corpus et domaines hétérogènes, sans toutefois le placer parmi les modèles de tête. Son architecture BERT à contexte long convient au traitement de documents étendus. La réduction Matryoshka offre un arbitrage pratique entre précision, taille d’index et vitesse de recherche. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration commerciale. Son espace est en outre aligné avec celui de nomic-embed-vision-v1.5, ce qui rend les embeddings texte compatibles avec un dispositif multimodal.
Limites et points d'attention. Les résultats sont faibles en espagnol, avec un classement proche du bas du tableau, et restent en retrait sur les ensembles European et French. Le domaine Medical présente également des performances modestes. La représentation dense en 768 dimensions alourdit davantage le stockage et le calcul de similarité que les variantes Matryoshka réduites. Les préfixes de tâche doivent être appliqués correctement, sous peine de ne pas respecter le format prévu. Sorti il y a environ deux ans, il est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique et RAG auto-hébergés, clustering, classification et index ajustables en dimension, particulièrement sur des corpus chimiques.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).