nomic-ai/nomic-embed-text-v1

Publié par Nomic AI le 31 janvier 2024, nomic-ai/nomic-embed-text-v1 est un modèle d’embedding dense de 137 millions de paramètres, sous licence ouverte Apache 2.0. Il produit des vecteurs de 768 dimensions et traite des séquences allant jusqu’à 8 192 tokens grâce à une architecture BERT…

Publié par Nomic AI le 31 janvier 2024, nomic-ai/nomic-embed-text-v1 est un modèle d’embedding dense de 137 millions de paramètres, sous licence ouverte Apache 2.0. Il produit des vecteurs de 768 dimensions et traite des séquences allant jusqu’à 8 192 tokens grâce à une architecture BERT adaptée au contexte long.

Sa couverture est multilingue, avec des évaluations en français et dans plusieurs langues européennes. Il sert à indexer des documents pour la recherche sémantique et le RAG, ainsi qu’au clustering et à la classification. Chaque tâche exige un préfixe d’instruction adapté. Les représentations peuvent aussi être rapprochées de celles de nomic-embed-vision-v1 pour des recherches texte-image.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNomic AI
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie31 janvier 2024
Dimension du vecteur768
Représentationdense
Paramètres137 millions
Paramètres actifs137 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR52,9 %65ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval47,7 %44ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal33,5 %111ᵉ / 208mteb✅ Mesuré
MTEB: Medical40,7 %70ᵉ / 158mteb✅ Mesuré
MTEB: Legal41,8 %65ᵉ / 157mteb✅ Mesuré
MTEB: European48,4 %67ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French22,6 %120ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German26,0 %105ᵉ / 209mteb✅ Mesuré
MTEB: Chemical70,6 %18ᵉ / 41mteb✅ Mesuré
MTEB: French49,0 %68ᵉ / 117mteb✅ Mesuré
MTEB: Indic36,2 %63ᵉ / 119mteb✅ Mesuré
MTEB: Russian29,0 %65ᵉ / 104mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur résultat relatif apparaît sur les textes du domaine chimique. Le modèle reste bien placé sur Long-context Retrieval, ce qui concorde avec sa fenêtre de 8 192 tokens et favorise l’indexation de documents longs. BEIR montre une aptitude exploitable à la recherche zero-shot sur des tâches et domaines variés. La licence Apache 2.0 autorise l’auto-hébergement, tandis que les vecteurs de 768 dimensions limitent la taille des index par rapport à des représentations plus larges. Les embeddings reposent sur un pooling moyen suivi d’une normalisation L2.

Limites et points d'attention. Les résultats en français et dans les langues européennes se situent plutôt en milieu de classement, sans avantage marqué face aux autres modèles évalués. Le juridique est également intermédiaire, ce qui invite à valider la qualité sur les corpus spécialisés visés. Les préfixes propres aux requêtes, documents, tâches de clustering ou de classification doivent être appliqués correctement. Avec environ deux ans d’ancienneté, ce modèle appartient à une génération très ancienne à l’échelle de l’IA, probablement dépassée par des embeddings plus récents et susceptible d’avoir été retirée des catalogues actuels. Usages pertinents : recherche sémantique, RAG sur documents longs, clustering, classification et rapprochement texte-image auto-hébergés.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).