infgrad/stella-base-en-v2
infgrad/stella-base-en-v2 est un modèle d’embedding anglophone publié par infgrad le 19 octobre 2023. Ses 109 millions de paramètres produisent des représentations denses de 768 dimensions, avec une longueur de séquence maximale de 512 tokens. Distribué sous licence ouverte MIT, il peut…
infgrad/stella-base-en-v2 est un modèle d’embedding anglophone publié par infgrad le 19 octobre 2023. Ses 109 millions de paramètres produisent des représentations denses de 768 dimensions, avec une longueur de séquence maximale de 512 tokens. Distribué sous licence ouverte MIT, il peut être exploité et auto-hébergé avec Sentence-Transformers ou Hugging Face Transformers.
Le modèle transforme les textes en vecteurs destinés à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité et au clustering. La recherche ne nécessite ni préfixe ni instruction. L’intégration avec Transformers repose sur un mean pooling suivi d’une normalisation L2.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | infgrad |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 19 octobre 2023 |
| Représentation | dense |
| Paramètres | 109 millions |
| Paramètres actifs | 109 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 50,0 % | 100ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 34,5 % | 104ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 29,9 % | 141ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 38,2 % | 89ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 38,8 % | 92ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 47,6 % | 72ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 18,0 % | 136ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 13,8 % | 152ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 50,3 % | 57ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Indic | 33,9 % | 73ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Russian | 27,1 % | 71ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: Korean | 21,3 % | 45ᵉ / 102 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent les ensembles French et BEIR, où le modèle se situe autour du milieu de tableau. Il conserve ainsi un intérêt pour la similarité textuelle et la recherche zero-shot sur des tâches et domaines hétérogènes, malgré une conception centrée sur l’anglais. Ses 109 millions de paramètres en font un encodeur relativement compact, tandis que les vecteurs de 768 dimensions offrent un compromis pratique pour constituer des index denses. La licence MIT facilite l’intégration, la modification et l’auto-hébergement, y compris dans des applications commerciales.
Limites et points d’attention. Les performances reculent sur les corpus européens, puis davantage sur les tâches juridiques, médicales et de Long-context Retrieval. La séquence maximale de 512 tokens impose de découper les documents longs avant indexation, ce qui peut fragmenter leur contexte. L’orientation anglophone limite aussi la pertinence attendue sur des usages multilingues, même si des évaluations françaises et européennes existent. Sorti il y a environ trois ans, il appartient à une génération ancienne à l’échelle de l’IA et apparaît probablement dépassé par des encodeurs plus récents. Usages pertinents : recherche sémantique anglophone, RAG sur passages courts, déduplication, similarité et clustering avec une infrastructure auto-hébergée.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).