nomic-ai/nomic-embed-text-v1-unsupervised

Publié par Nomic AI le 15 janvier 2024 sous licence ouverte Apache 2.0, nomic-ai/nomic-embed-text-v1-unsupervised est un encodeur dense de 137 millions de paramètres. Il produit des vecteurs de 768 dimensions et accepte des séquences allant jusqu’à 8 192 tokens.

Publié par Nomic AI le 15 janvier 2024 sous licence ouverte Apache 2.0, nomic-ai/nomic-embed-text-v1-unsupervised est un encodeur dense de 137 millions de paramètres. Il produit des vecteurs de 768 dimensions et accepte des séquences allant jusqu’à 8 192 tokens.

Évalué sur le français, l’allemand et plusieurs langues européennes, ce modèle d’embedding sert à indexer des textes pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Il correspond à un checkpoint issu du préentraînement contrastif en plusieurs étapes de nomic-embed-text-v1.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNomic AI
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie15 janvier 2024
Dimension du vecteur768
Représentationdense
Paramètres137 millions
Paramètres actifs137 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR48,0 %116ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval55,5 %39ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal38,3 %85ᵉ / 208mteb✅ Mesuré
MTEB: Medical40,9 %66ᵉ / 158mteb✅ Mesuré
MTEB: Legal45,5 %52ᵉ / 157mteb✅ Mesuré
MTEB: European49,0 %62ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French23,4 %117ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German30,4 %95ᵉ / 209mteb✅ Mesuré
MTEB: French50,5 %56ᵉ / 117mteb✅ Mesuré
MTEB: German42,9 %40ᵉ / 96mteb✅ Mesuré
MTEB: Indic36,3 %61ᵉ / 119mteb✅ Mesuré
MTEB: Russian30,5 %63ᵉ / 104mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ nomic-ai/nomic-embed-te…48 %

MTEB: Long-context Retrieval

▶ nomic-ai/nomic-embed-te…56 %
dwzhu/e5-base-4k55 %

Notre analyse

Forces. Le meilleur positionnement relatif du modèle apparaît sur MTEB Long-context Retrieval, ce qui rejoint sa capacité à encoder des séquences de 8 192 tokens et le rend adapté aux documents longs. Ses résultats en allemand et en français permettent aussi d’envisager des corpus européens et multilingues. Le track Legal le situe correctement pour la recherche dans des textes juridiques. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des systèmes de recherche ou de RAG, tandis que ses 137 millions de paramètres restent contenus pour un encodeur dense.

Limites et points d'attention. Le positionnement sur BEIR est nettement moins favorable, signe d’une robustesse limitée en recherche zero-shot sur des domaines et tâches hétérogènes. Les tracks French et European restent en milieu de classement plutôt qu’au niveau des références les mieux placées. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, ce checkpoint est probablement dépassé par des modèles plus récents. Nomic AI recommande d’ailleurs nomic-embed-text-v1 pour l’extraction d’embeddings. Usages pertinents : expérimentation reproductible, auto-hébergement et recherche sur des documents longs, notamment dans des corpus européens ou juridiques.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).