nomic-ai/nomic-embed-text-v1.5

Publié par Nomic AI le 10 février 2024 sous licence ouverte Apache 2.0, nomic-ai/nomic-embed-text-v1.5 est un modèle d’embedding dense de 137 millions de paramètres. Issu d’un BERT à contexte long, il produit par défaut des vecteurs de 768 dimensions et couvre notamment des évaluations…

Publié par Nomic AI le 10 février 2024 sous licence ouverte Apache 2.0, nomic-ai/nomic-embed-text-v1.5 est un modèle d’embedding dense de 137 millions de paramètres. Issu d’un BERT à contexte long, il produit par défaut des vecteurs de 768 dimensions et couvre notamment des évaluations en anglais, français, espagnol et autres langues européennes.

Il transforme les textes en vecteurs destinés à la recherche sémantique, au RAG, au clustering et à la classification. Chaque entrée requiert un préfixe correspondant à la tâche, comme search_document, search_query, clustering ou classification. Matryoshka Representation Learning permet aussi d’utiliser des représentations réduites à 512, 256, 128 ou 64 dimensions.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNomic AI
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie10 février 2024
Dimension du vecteur768
Représentationdense uniquement
Paramètres137 millions
Paramètres actifs137 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR51,8 %77ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval30,6 %124ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal26,5 %165ᵉ / 208mteb✅ Mesuré
MTEB: Medical37,3 %94ᵉ / 158mteb✅ Mesuré
MTEB: Legal35,8 %108ᵉ / 157mteb✅ Mesuré
MTEB: European46,3 %84ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French18,5 %135ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German9,0 %180ᵉ / 209mteb✅ Mesuré
MTEB: Chemical71,8 %12ᵉ / 41mteb✅ Mesuré
MTEB: Spanish48,9 %25ᵉ / 27mteb✅ Mesuré
MTEB: French45,6 %84ᵉ / 117mteb✅ Mesuré
MTEB: Indic35,6 %65ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ nomic-ai/nomic-embed-te…52 %

MTEB: Long-context Retrieval

▶ nomic-ai/nomic-embed-te…31 %
consciousAI/cai-lunaris…30 %

Notre analyse

Forces. Son meilleur positionnement MTEB concerne les textes du domaine Chemical, où il se classe dans le premier tiers. Sur BEIR, ses résultats traduisent une aptitude plus générale à la recherche zero-shot dans des corpus et domaines hétérogènes, sans toutefois le placer parmi les modèles de tête. Son architecture BERT à contexte long convient au traitement de documents étendus. La réduction Matryoshka offre un arbitrage pratique entre précision, taille d’index et vitesse de recherche. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration commerciale. Son espace est en outre aligné avec celui de nomic-embed-vision-v1.5, ce qui rend les embeddings texte compatibles avec un dispositif multimodal.

Limites et points d'attention. Les résultats sont faibles en espagnol, avec un classement proche du bas du tableau, et restent en retrait sur les ensembles European et French. Le domaine Medical présente également des performances modestes. La représentation dense en 768 dimensions alourdit davantage le stockage et le calcul de similarité que les variantes Matryoshka réduites. Les préfixes de tâche doivent être appliqués correctement, sous peine de ne pas respecter le format prévu. Sorti il y a environ deux ans, il est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique et RAG auto-hébergés, clustering, classification et index ajustables en dimension, particulièrement sur des corpus chimiques.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).