nomic-ai/nomic-embed-text-v1-unsupervised
Publié par Nomic AI le 15 janvier 2024 sous licence ouverte Apache 2.0, nomic-ai/nomic-embed-text-v1-unsupervised est un encodeur dense de 137 millions de paramètres. Il produit des vecteurs de 768 dimensions et accepte des séquences allant jusqu’à 8 192 tokens.
Publié par Nomic AI le 15 janvier 2024 sous licence ouverte Apache 2.0, nomic-ai/nomic-embed-text-v1-unsupervised est un encodeur dense de 137 millions de paramètres. Il produit des vecteurs de 768 dimensions et accepte des séquences allant jusqu’à 8 192 tokens.
Évalué sur le français, l’allemand et plusieurs langues européennes, ce modèle d’embedding sert à indexer des textes pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Il correspond à un checkpoint issu du préentraînement contrastif en plusieurs étapes de nomic-embed-text-v1.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Nomic AI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 15 janvier 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 137 millions |
| Paramètres actifs | 137 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 48,0 % | 116ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 55,5 % | 39ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 38,3 % | 85ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 40,9 % | 66ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 45,5 % | 52ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 49,0 % | 62ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 23,4 % | 117ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 30,4 % | 95ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 50,5 % | 56ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 42,9 % | 40ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Indic | 36,3 % | 61ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Russian | 30,5 % | 63ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur positionnement relatif du modèle apparaît sur MTEB Long-context Retrieval, ce qui rejoint sa capacité à encoder des séquences de 8 192 tokens et le rend adapté aux documents longs. Ses résultats en allemand et en français permettent aussi d’envisager des corpus européens et multilingues. Le track Legal le situe correctement pour la recherche dans des textes juridiques. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des systèmes de recherche ou de RAG, tandis que ses 137 millions de paramètres restent contenus pour un encodeur dense.
Limites et points d'attention. Le positionnement sur BEIR est nettement moins favorable, signe d’une robustesse limitée en recherche zero-shot sur des domaines et tâches hétérogènes. Les tracks French et European restent en milieu de classement plutôt qu’au niveau des références les mieux placées. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, ce checkpoint est probablement dépassé par des modèles plus récents. Nomic AI recommande d’ailleurs nomic-embed-text-v1 pour l’extraction d’embeddings. Usages pertinents : expérimentation reproductible, auto-hébergement et recherche sur des documents longs, notamment dans des corpus européens ou juridiques.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).