Snowflake/snowflake-arctic-embed-m

Snowflake/snowflake-arctic-embed-m est un modèle d’embedding dense publié par Snowflake le 12 avril 2024 sous licence ouverte Apache 2.0. Dérivé d’intfloat/e5-base-unsupervised, ce modèle de taille moyenne compte 109 millions de paramètres, tous actifs, et produit des vecteurs de 768…

Snowflake/snowflake-arctic-embed-m est un modèle d’embedding dense publié par Snowflake le 12 avril 2024 sous licence ouverte Apache 2.0. Dérivé d’intfloat/e5-base-unsupervised, ce modèle de taille moyenne compte 109 millions de paramètres, tous actifs, et produit des vecteurs de 768 dimensions.

Conçu pour la recherche de documents, il transforme les textes en représentations numériques adaptées à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Il s’intègre à Sentence Transformers, Hugging Face Transformers et Transformers.js, ce qui facilite son auto-hébergement et son insertion dans des chaînes d’indexation.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSnowflake
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie12 avril 2024
Dimension du vecteur768
Représentationdense
Paramètres109 millions
Paramètres actifs109 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR54,9 %44ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval40,1 %74ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal33,3 %112ᵉ / 208mteb✅ Mesuré
MTEB: Medical40,8 %68ᵉ / 158mteb✅ Mesuré
MTEB: Legal39,8 %82ᵉ / 157mteb✅ Mesuré
MTEB: European45,6 %92ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French28,6 %95ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German15,4 %144ᵉ / 209mteb✅ Mesuré
MTEB: French46,5 %80ᵉ / 117mteb✅ Mesuré
MTEB: Dutch38,4 %78ᵉ / 113mteb✅ Mesuré
MTEB: German37,3 %65ᵉ / 96mteb✅ Mesuré
MTEB: Indic33,6 %75ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ Snowflake/snowflake-arc…55 %
WhereIsAI/UAE-Large-V155 %

MTEB: Long-context Retrieval

WhereIsAI/UAE-Large-V140 %
▶ Snowflake/snowflake-arc…40 %

Notre analyse

Forces. Son meilleur positionnement MTEB concerne BEIR, ce qui en fait principalement un modèle de recherche zero-shot sur des tâches et domaines hétérogènes. Les évaluations Medical et Long-context Retrieval le placent également dans une zone intermédiaire relativement solide, sans en faire une référence spécialisée. Sa licence Apache 2.0 autorise l’auto-hébergement et l’adaptation à des usages commerciaux. La sortie en 768 dimensions offre un compromis pratique entre richesse de représentation, taille des index et coût de recherche. Avec Transformers, l’encodage repose sur le jeton CLS, une normalisation L2 et un préfixe réservé aux requêtes.

Limites et points d’attention. Les résultats French et European se situent dans la partie basse de leurs classements, tandis que Legal reste proche du milieu de tableau. Le modèle paraît donc moins convaincant pour les corpus francophones, européens ou juridiques que pour la recherche généraliste évaluée par BEIR. Sorti en avril 2024, il est désormais ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents de catégories comparables. Usages pertinents : recherche documentaire généraliste, RAG auto-hébergé, similarité sémantique et clustering lorsque la compatibilité avec l’écosystème Transformers et une licence permissive priment.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).