NovaSearch/stella_en_400M_v5

NovaSearch/stella_en_400M_v5 est un modèle d’embedding dense de 435 millions de paramètres, publié par NovaSearch sous licence ouverte MIT. Orienté vers l’anglais, il produit des vecteurs de 4096 dimensions et recommande une longueur de séquence de 512 tokens.

NovaSearch/stella_en_400M_v5 est un modèle d’embedding dense de 435 millions de paramètres, publié par NovaSearch sous licence ouverte MIT. Orienté vers l’anglais, il produit des vecteurs de 4096 dimensions et recommande une longueur de séquence de 512 tokens.

Il transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Entraîné à partir de modèles GTE puis avec MRL, il prend aussi en charge plusieurs dimensions, de 512 à 8192, avec 1024 par défaut. Son encodage est compatible avec SentenceTransformers et Transformers.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNovaSearch
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie12 juillet 2024
Dimension du vecteur4 096
Représentationdense
Paramètres435 millions
Paramètres actifs435 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR57,9 %22ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval42,3 %58ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal37,5 %88ᵉ / 208mteb✅ Mesuré
MTEB: Medical43,5 %53ᵉ / 158mteb✅ Mesuré
MTEB: Legal44,9 %53ᵉ / 157mteb✅ Mesuré
MTEB: European53,9 %42ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French27,2 %105ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German21,7 %114ᵉ / 209mteb✅ Mesuré
MTEB: French57,0 %29ᵉ / 117mteb✅ Mesuré
MTEB: Indic37,1 %54ᵉ / 119mteb✅ Mesuré
MTEB: Korean21,0 %49ᵉ / 102mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur positionnement MTEB de NovaSearch/stella_en_400M_v5 concerne BEIR, ce qui en fait principalement un modèle de recherche zero-shot sur des tâches et domaines hétérogènes. Ses résultats en français et dans les langues européennes restent relativement bien classés, malgré son orientation anglophone. Deux prompts distinguent la recherche phrase-vers-passage de la similarité phrase-vers-phrase, tandis que les documents sont encodés sans prompt. La licence MIT facilite l’auto-hébergement et l’intégration commerciale. MRL permet aussi de choisir une représentation plus compacte afin d’alléger les index.

Limites et points d’attention. Les évaluations Legal et Medical se situent dans le tiers intermédiaire, et Long-context Retrieval est moins convaincant que BEIR. La longueur recommandée de 512 tokens limite le traitement direct de documents longs et peut imposer un découpage préalable. À 4096 dimensions, les vecteurs augmentent l’espace de stockage, la mémoire et le coût de recherche, même si des dimensions réduites sont disponibles. Sorti en juillet 2024, le modèle approche deux ans, une ancienneté très longue à l’échelle de l’IA, et il est probablement dépassé par des embeddings plus récents de sa catégorie. Usages pertinents : recherche sémantique anglophone, RAG sur passages courts, similarité de phrases et clustering, avec validation préalable pour le français, le juridique et le médical.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).