nomic-ai/nomic-embed-text-v1-ablated
Publié par Nomic AI le 15 janvier 2024, nomic-ai/nomic-embed-text-v1-ablated est un encodeur de 137 millions de paramètres sous licence ouverte Apache 2.0. Il produit des représentations denses de 768 dimensions et accepte jusqu’à 8 192 tokens, une longueur adaptée à l’encodage de…
Publié par Nomic AI le 15 janvier 2024, nomic-ai/nomic-embed-text-v1-ablated est un encodeur de 137 millions de paramètres sous licence ouverte Apache 2.0. Il produit des représentations denses de 768 dimensions et accepte jusqu’à 8 192 tokens, une longueur adaptée à l’encodage de documents étendus.
Le modèle transforme les textes en vecteurs destinés à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité et au clustering. Évalué en anglais et dans plusieurs langues européennes, il constitue un checkpoint d’ablation conçu pour mesurer l’effet de différents sous-ensembles des données d’entraînement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Nomic AI |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 15 janvier 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 137 millions |
| Paramètres actifs | 137 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 51,4 % | 84ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Medical | 43,5 % | 52ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: European | 49,2 % | 58ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 25,9 % | 110ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 25,2 % | 107ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: European
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent European et Medical, où le modèle se place dans la première moitié des classements. Il présente aussi un niveau intermédiaire sur BEIR, qui couvre la recherche zero-shot dans des tâches et domaines variés. Sa fenêtre de 8 192 tokens facilite la vectorisation de contenus longs. Les vecteurs de 768 dimensions offrent un compromis exploitable entre richesse de représentation et taille d’index, tandis que la licence Apache 2.0 autorise l’auto-hébergement et les usages commerciaux.
Limites et points d’attention. Les performances sont nettement plus faibles sur RTEB French et RTEB German, notamment pour la recherche en français et en allemand dans des domaines juridiques, médicaux ou professionnels. Le résultat presque en bas du classement sur Instruction Following indique une mauvaise adaptation aux requêtes de recherche assorties de consignes. Ce checkpoint d’ablation sert d’abord à étudier l’impact des données d’entraînement, plutôt qu’à représenter la version finale du modèle. Après environ deux ans, une durée très longue à l’échelle de l’IA, il est probablement dépassé par des modèles plus récents et peut avoir été retiré des catalogues courants. Usages pertinents : expérimentation, comparaison de jeux de données, prototypes de recherche sémantique et RAG auto-hébergés sur des corpus longs.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).