NovaSearch/stella_en_1.5B_v5

NovaSearch/stella_en_1.5B_v5 est un modèle d’embedding dense à vecteur unique publié par NovaSearch le 12 juillet 2024 sous licence ouverte MIT. Ses 2 milliards de paramètres sont actifs, et sa dimension de sortie recensée atteint 8 960.

NovaSearch/stella_en_1.5B_v5 est un modèle d’embedding dense à vecteur unique publié par NovaSearch le 12 juillet 2024 sous licence ouverte MIT. Ses 2 milliards de paramètres sont actifs, et sa dimension de sortie recensée atteint 8 960.

Issu de modèles anglophones d’Alibaba-NLP, il a été entraîné sur des séquences de 512 tokens et évalué dans plusieurs langues. Il transforme les textes en vecteurs pour la recherche sémantique, le RAG, la similarité et le clustering. MRL permet de configurer des dimensions de 512 à 8 192, avec 1 024 par défaut.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurNovaSearch
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie12 juillet 2024
Dimension du vecteur8 960
Représentationdense à vecteur unique, avec dimensions configurables
Paramètres2 milliards
Paramètres actifs2 milliards
Longueur de séquence max131 072 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR59,3 %13ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval46,5 %47ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal39,6 %80ᵉ / 208mteb✅ Mesuré
MTEB: Medical59,4 %24ᵉ / 158mteb✅ Mesuré
MTEB: Legal50,3 %41ᵉ / 157mteb✅ Mesuré
MTEB: European59,8 %20ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French47,7 %53ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German40,4 %82ᵉ / 209mteb✅ Mesuré
MTEB: Russian63,1 %18ᵉ / 104mteb✅ Mesuré
MTEB: French62,9 %17ᵉ / 117mteb✅ Mesuré
MTEB: Indic52,3 %42ᵉ / 119mteb✅ Mesuré
MTEB: Instruction Following0,2 %56ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

zeta-alpha-ai/Zeta-Alph…59 %
▶ NovaSearch/stella_en_1.…59 %

MTEB: Long-context Retrieval

▶ NovaSearch/stella_en_1.…47 %

Notre analyse

Forces. Le meilleur positionnement relatif apparaît sur BEIR, ce qui indique de solides aptitudes en recherche zero-shot sur des tâches et domaines hétérogènes. Les résultats en français, en russe et à l’échelle européenne le placent également dans le groupe de tête des modèles évalués, tandis que le track Medical confirme son intérêt pour la recherche d’informations cliniques, biomédicales et de santé grand public. Les prompts `s2p_query` et `s2s_query` distinguent la recherche phrase-vers-passage de la similarité phrase-vers-phrase. Les dimensions configurables permettent d’alléger les index, et la licence MIT facilite l’auto-hébergement. L’encodage fonctionne avec SentenceTransformers ou Transformers.

Limites et points d’attention. Le track Indic constitue son résultat relatif le plus faible, avec un positionnement moins favorable que sur les langues européennes. La séquence d’entraînement limitée à 512 tokens réduit son intérêt pour les documents longs sans découpage préalable. À pleine dimension, les vecteurs entraînent des index plus volumineux et une recherche plus coûteuse, malgré les formats MRL plus compacts. Sorti en 2024, le modèle est ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents, voire retiré des catalogues actuels de l’éditeur. Usages pertinents : recherche sémantique, RAG, similarité et clustering, notamment en anglais et dans plusieurs langues européennes.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).