Snowflake/snowflake-arctic-embed-s
Snowflake/snowflake-arctic-embed-s est un modèle d’embedding dense publié par Snowflake le 12 avril 2024 sous licence ouverte Apache 2.0. Fondé sur intfloat/e5-small-unsupervised, il compte 33 millions de paramètres actifs et représente chaque texte par un vecteur compact de 384…
Snowflake/snowflake-arctic-embed-s est un modèle d’embedding dense publié par Snowflake le 12 avril 2024 sous licence ouverte Apache 2.0. Fondé sur intfloat/e5-small-unsupervised, il compte 33 millions de paramètres actifs et représente chaque texte par un vecteur compact de 384 dimensions issu du jeton CLS.
Il sert à indexer des textes pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité et le clustering. Son entraînement associe des paires requête-document, puis des triplets comprenant des négatifs difficiles. Les évaluations MTEB couvrent notamment le français, l’allemand, le néerlandais et plusieurs langues européennes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Snowflake |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 12 avril 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense, un vecteur par texte à partir du jeton CLS |
| Paramètres | 33 millions |
| Paramètres actifs | 33 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 52,0 % | 73ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 39,5 % | 76ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 31,8 % | 127ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 38,1 % | 90ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 38,0 % | 94ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 46,1 % | 87ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 24,1 % | 113ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 17,7 % | 126ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 48,1 % | 72ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 39,7 % | 56ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 39,4 % | 76ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Indic | 33,0 % | 81ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur résultat relatif du modèle apparaît sur BEIR, consacré à la recherche zero-shot dans des tâches et domaines hétérogènes. Ce profil correspond directement à la récupération de documents et de passages. Les tracks French, European, German et Dutch montrent aussi une aptitude mesurée sur plusieurs langues, pour des tâches de classification, de clustering, de comparaison de paires et de recherche multilingue. La sortie dense de 384 dimensions permet de limiter la taille des index et le coût des calculs de similarité. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration commerciale. Avec Transformers, le jeton CLS est normalisé en L2 et la similarité se calcule par produit matriciel.
Limites et points d'attention. Les classements MTEB restent intermédiaires ou en retrait, notamment sur les ensembles European, French et Dutch. Le track Long-context Retrieval ne place pas non plus le modèle parmi les références de tête pour la récupération dans des contenus longs. Son usage impose en outre de distinguer les requêtes, accompagnées du préfixe ou prompt « query », des documents sans préfixe. Sorti il y a environ deux ans, il appartient à une génération ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et souvent retirée des catalogues actuels. Usages pertinents : recherche sémantique compacte, RAG généraliste, déduplication, similarité et clustering avec déploiement auto-hébergé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).