Snowflake/snowflake-arctic-embed-xs

Snowflake/snowflake-arctic-embed-xs est un modèle d’embedding dense publié par Snowflake le 8 juillet 2024 sous licence ouverte Apache 2.0. Ses 23 millions de paramètres produisent des vecteurs de 384 dimensions, un format compact adapté à la constitution d’index vectoriels.

Snowflake/snowflake-arctic-embed-xs est un modèle d’embedding dense publié par Snowflake le 8 juillet 2024 sous licence ouverte Apache 2.0. Ses 23 millions de paramètres produisent des vecteurs de 384 dimensions, un format compact adapté à la constitution d’index vectoriels.

Fondé sur all-MiniLM-L6-v2, il transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Son entraînement pour la recherche combine des paires requête-document puis des triplets intégrant des négatifs difficiles. Il fonctionne avec Sentence Transformers, Hugging Face Transformers et Transformers.js.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSnowflake
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie8 juillet 2024
Dimension du vecteur384
Représentationdense
Paramètres23 millions
Paramètres actifs23 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR50,1 %98ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval36,8 %94ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal28,9 %150ᵉ / 208mteb✅ Mesuré
MTEB: Medical34,3 %101ᵉ / 158mteb✅ Mesuré
MTEB: Legal35,7 %111ᵉ / 157mteb✅ Mesuré
MTEB: European43,4 %103ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French16,1 %142ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German9,7 %177ᵉ / 209mteb✅ Mesuré
MTEB: French43,9 %89ᵉ / 117mteb✅ Mesuré
MTEB: German35,5 %74ᵉ / 96mteb✅ Mesuré
MTEB: Dutch35,1 %89ᵉ / 113mteb✅ Mesuré
MTEB: Indic32,7 %84ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

dwzhu/e5-base-4k50 %
▶ Snowflake/snowflake-arc…50 %

MTEB: Long-context Retrieval

▶ Snowflake/snowflake-arc…37 %

Notre analyse

Forces. Son meilleur résultat relatif apparaît sur BEIR, consacré à la recherche zero-shot dans des tâches et domaines hétérogènes, même si son classement reste proche du milieu du panel évalué. L’entraînement orienté retrieval et l’emploi d’un préfixe réservé aux requêtes répondent directement aux besoins d’appariement entre questions et documents. Avec Transformers, la représentation repose sur le jeton CLS normalisé. Les vecteurs de 384 dimensions permettent des index plus légers que ceux produits par des embeddings de grande dimension. La licence Apache 2.0 facilite l’auto-hébergement, l’intégration et l’adaptation.

Limites et points d’attention. Les évaluations French et European le placent dans la partie basse de leurs classements, tandis que German est également en retrait. Les résultats sont plus faibles encore en proportion sur Long-context Retrieval et Legal, ce qui réduit son intérêt pour les documents longs et la recherche juridique spécialisée. Sorti en 2024, il est ancien à l’échelle rapide de l’IA et probablement dépassé par des modèles plus récents de même catégorie. Usages pertinents : recherche sémantique généraliste, RAG compact, similarité de textes et clustering lorsque la légèreté de l’index et l’auto-hébergement priment.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).