Snowflake/snowflake-arctic-embed-s

Snowflake/snowflake-arctic-embed-s est un modèle d’embedding dense publié par Snowflake le 12 avril 2024 sous licence ouverte Apache 2.0. Fondé sur intfloat/e5-small-unsupervised, il compte 33 millions de paramètres actifs et représente chaque texte par un vecteur compact de 384…

Snowflake/snowflake-arctic-embed-s est un modèle d’embedding dense publié par Snowflake le 12 avril 2024 sous licence ouverte Apache 2.0. Fondé sur intfloat/e5-small-unsupervised, il compte 33 millions de paramètres actifs et représente chaque texte par un vecteur compact de 384 dimensions issu du jeton CLS.

Il sert à indexer des textes pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité et le clustering. Son entraînement associe des paires requête-document, puis des triplets comprenant des négatifs difficiles. Les évaluations MTEB couvrent notamment le français, l’allemand, le néerlandais et plusieurs langues européennes.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSnowflake
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie12 avril 2024
Dimension du vecteur384
Représentationdense, un vecteur par texte à partir du jeton CLS
Paramètres33 millions
Paramètres actifs33 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR52,0 %73ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval39,5 %76ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal31,8 %127ᵉ / 208mteb✅ Mesuré
MTEB: Medical38,1 %90ᵉ / 158mteb✅ Mesuré
MTEB: Legal38,0 %94ᵉ / 157mteb✅ Mesuré
MTEB: European46,1 %87ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French24,1 %113ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German17,7 %126ᵉ / 209mteb✅ Mesuré
MTEB: French48,1 %72ᵉ / 117mteb✅ Mesuré
MTEB: German39,7 %56ᵉ / 96mteb✅ Mesuré
MTEB: Dutch39,4 %76ᵉ / 113mteb✅ Mesuré
MTEB: Indic33,0 %81ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ Snowflake/snowflake-arc…52 %
llmrails/ember-v152 %

MTEB: Long-context Retrieval

WhereIsAI/UAE-Large-V140 %
▶ Snowflake/snowflake-arc…40 %

Notre analyse

Forces. Le meilleur résultat relatif du modèle apparaît sur BEIR, consacré à la recherche zero-shot dans des tâches et domaines hétérogènes. Ce profil correspond directement à la récupération de documents et de passages. Les tracks French, European, German et Dutch montrent aussi une aptitude mesurée sur plusieurs langues, pour des tâches de classification, de clustering, de comparaison de paires et de recherche multilingue. La sortie dense de 384 dimensions permet de limiter la taille des index et le coût des calculs de similarité. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration commerciale. Avec Transformers, le jeton CLS est normalisé en L2 et la similarité se calcule par produit matriciel.

Limites et points d'attention. Les classements MTEB restent intermédiaires ou en retrait, notamment sur les ensembles European, French et Dutch. Le track Long-context Retrieval ne place pas non plus le modèle parmi les références de tête pour la récupération dans des contenus longs. Son usage impose en outre de distinguer les requêtes, accompagnées du préfixe ou prompt « query », des documents sans préfixe. Sorti il y a environ deux ans, il appartient à une génération ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et souvent retirée des catalogues actuels. Usages pertinents : recherche sémantique compacte, RAG généraliste, déduplication, similarité et clustering avec déploiement auto-hébergé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).