NovaSearch/stella_en_400M_v5
NovaSearch/stella_en_400M_v5 est un modèle d’embedding dense de 435 millions de paramètres, publié par NovaSearch sous licence ouverte MIT. Orienté vers l’anglais, il produit des vecteurs de 4096 dimensions et recommande une longueur de séquence de 512 tokens.
NovaSearch/stella_en_400M_v5 est un modèle d’embedding dense de 435 millions de paramètres, publié par NovaSearch sous licence ouverte MIT. Orienté vers l’anglais, il produit des vecteurs de 4096 dimensions et recommande une longueur de séquence de 512 tokens.
Il transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Entraîné à partir de modèles GTE puis avec MRL, il prend aussi en charge plusieurs dimensions, de 512 à 8192, avec 1024 par défaut. Son encodage est compatible avec SentenceTransformers et Transformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | NovaSearch |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 12 juillet 2024 |
| Dimension du vecteur | 4 096 |
| Représentation | dense |
| Paramètres | 435 millions |
| Paramètres actifs | 435 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 57,9 % | 22ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 42,3 % | 58ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 37,5 % | 88ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 43,5 % | 53ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 44,9 % | 53ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 53,9 % | 42ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 27,2 % | 105ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 21,7 % | 114ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 57,0 % | 29ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Indic | 37,1 % | 54ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Korean | 21,0 % | 49ᵉ / 102 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur positionnement MTEB de NovaSearch/stella_en_400M_v5 concerne BEIR, ce qui en fait principalement un modèle de recherche zero-shot sur des tâches et domaines hétérogènes. Ses résultats en français et dans les langues européennes restent relativement bien classés, malgré son orientation anglophone. Deux prompts distinguent la recherche phrase-vers-passage de la similarité phrase-vers-phrase, tandis que les documents sont encodés sans prompt. La licence MIT facilite l’auto-hébergement et l’intégration commerciale. MRL permet aussi de choisir une représentation plus compacte afin d’alléger les index.
Limites et points d’attention. Les évaluations Legal et Medical se situent dans le tiers intermédiaire, et Long-context Retrieval est moins convaincant que BEIR. La longueur recommandée de 512 tokens limite le traitement direct de documents longs et peut imposer un découpage préalable. À 4096 dimensions, les vecteurs augmentent l’espace de stockage, la mémoire et le coût de recherche, même si des dimensions réduites sont disponibles. Sorti en juillet 2024, le modèle approche deux ans, une ancienneté très longue à l’échelle de l’IA, et il est probablement dépassé par des embeddings plus récents de sa catégorie. Usages pertinents : recherche sémantique anglophone, RAG sur passages courts, similarité de phrases et clustering, avec validation préalable pour le français, le juridique et le médical.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).