nomic-ai/nomic-embed-text-v1
Publié par Nomic AI le 31 janvier 2024, nomic-ai/nomic-embed-text-v1 est un modèle d’embedding dense de 137 millions de paramètres, sous licence ouverte Apache 2.0. Il produit des vecteurs de 768 dimensions et traite des séquences allant jusqu’à 8 192 tokens grâce à une architecture BERT…
Publié par Nomic AI le 31 janvier 2024, nomic-ai/nomic-embed-text-v1 est un modèle d’embedding dense de 137 millions de paramètres, sous licence ouverte Apache 2.0. Il produit des vecteurs de 768 dimensions et traite des séquences allant jusqu’à 8 192 tokens grâce à une architecture BERT adaptée au contexte long.
Sa couverture est multilingue, avec des évaluations en français et dans plusieurs langues européennes. Il sert à indexer des documents pour la recherche sémantique et le RAG, ainsi qu’au clustering et à la classification. Chaque tâche exige un préfixe d’instruction adapté. Les représentations peuvent aussi être rapprochées de celles de nomic-embed-vision-v1 pour des recherches texte-image.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Nomic AI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 31 janvier 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 137 millions |
| Paramètres actifs | 137 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 52,9 % | 65ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 47,7 % | 44ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 33,5 % | 111ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 40,7 % | 70ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 41,8 % | 65ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 48,4 % | 67ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 22,6 % | 120ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 26,0 % | 105ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 70,6 % | 18ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: French | 49,0 % | 68ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Indic | 36,2 % | 63ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Russian | 29,0 % | 65ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur résultat relatif apparaît sur les textes du domaine chimique. Le modèle reste bien placé sur Long-context Retrieval, ce qui concorde avec sa fenêtre de 8 192 tokens et favorise l’indexation de documents longs. BEIR montre une aptitude exploitable à la recherche zero-shot sur des tâches et domaines variés. La licence Apache 2.0 autorise l’auto-hébergement, tandis que les vecteurs de 768 dimensions limitent la taille des index par rapport à des représentations plus larges. Les embeddings reposent sur un pooling moyen suivi d’une normalisation L2.
Limites et points d'attention. Les résultats en français et dans les langues européennes se situent plutôt en milieu de classement, sans avantage marqué face aux autres modèles évalués. Le juridique est également intermédiaire, ce qui invite à valider la qualité sur les corpus spécialisés visés. Les préfixes propres aux requêtes, documents, tâches de clustering ou de classification doivent être appliqués correctement. Avec environ deux ans d’ancienneté, ce modèle appartient à une génération très ancienne à l’échelle de l’IA, probablement dépassée par des embeddings plus récents et susceptible d’avoir été retirée des catalogues actuels. Usages pertinents : recherche sémantique, RAG sur documents longs, clustering, classification et rapprochement texte-image auto-hébergés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).