NovaSearch/stella_en_1.5B_v5
NovaSearch/stella_en_1.5B_v5 est un modèle d’embedding dense à vecteur unique publié par NovaSearch le 12 juillet 2024 sous licence ouverte MIT. Ses 2 milliards de paramètres sont actifs, et sa dimension de sortie recensée atteint 8 960.
NovaSearch/stella_en_1.5B_v5 est un modèle d’embedding dense à vecteur unique publié par NovaSearch le 12 juillet 2024 sous licence ouverte MIT. Ses 2 milliards de paramètres sont actifs, et sa dimension de sortie recensée atteint 8 960.
Issu de modèles anglophones d’Alibaba-NLP, il a été entraîné sur des séquences de 512 tokens et évalué dans plusieurs langues. Il transforme les textes en vecteurs pour la recherche sémantique, le RAG, la similarité et le clustering. MRL permet de configurer des dimensions de 512 à 8 192, avec 1 024 par défaut.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | NovaSearch |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 12 juillet 2024 |
| Dimension du vecteur | 8 960 |
| Représentation | dense à vecteur unique, avec dimensions configurables |
| Paramètres | 2 milliards |
| Paramètres actifs | 2 milliards |
| Longueur de séquence max | 131 072 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 59,3 % | 13ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 46,5 % | 47ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 39,6 % | 80ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 59,4 % | 24ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 50,3 % | 41ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 59,8 % | 20ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 47,7 % | 53ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 40,4 % | 82ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Russian | 63,1 % | 18ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: French | 62,9 % | 17ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Indic | 52,3 % | 42ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 0,2 % | 56ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur positionnement relatif apparaît sur BEIR, ce qui indique de solides aptitudes en recherche zero-shot sur des tâches et domaines hétérogènes. Les résultats en français, en russe et à l’échelle européenne le placent également dans le groupe de tête des modèles évalués, tandis que le track Medical confirme son intérêt pour la recherche d’informations cliniques, biomédicales et de santé grand public. Les prompts `s2p_query` et `s2s_query` distinguent la recherche phrase-vers-passage de la similarité phrase-vers-phrase. Les dimensions configurables permettent d’alléger les index, et la licence MIT facilite l’auto-hébergement. L’encodage fonctionne avec SentenceTransformers ou Transformers.
Limites et points d’attention. Le track Indic constitue son résultat relatif le plus faible, avec un positionnement moins favorable que sur les langues européennes. La séquence d’entraînement limitée à 512 tokens réduit son intérêt pour les documents longs sans découpage préalable. À pleine dimension, les vecteurs entraînent des index plus volumineux et une recherche plus coûteuse, malgré les formats MRL plus compacts. Sorti en 2024, le modèle est ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents, voire retiré des catalogues actuels de l’éditeur. Usages pertinents : recherche sémantique, RAG, similarité et clustering, notamment en anglais et dans plusieurs langues européennes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).