Snowflake/snowflake-arctic-embed-l

Snowflake/snowflake-arctic-embed-l est un modèle d’embedding dense publié par Snowflake le 12 avril 2024 sous licence ouverte Apache 2.0. Fondé sur intfloat/e5-large-unsupervised, il compte 335 millions de paramètres, tous actifs, et transforme chaque texte en un vecteur de 1 024…

Snowflake/snowflake-arctic-embed-l est un modèle d’embedding dense publié par Snowflake le 12 avril 2024 sous licence ouverte Apache 2.0. Fondé sur intfloat/e5-large-unsupervised, il compte 335 millions de paramètres, tous actifs, et transforme chaque texte en un vecteur de 1 024 dimensions.

Le modèle est conçu pour la correspondance entre requêtes et documents, notamment en recherche sémantique, en récupération documentaire pour le RAG, en mesure de similarité et en clustering. Il extrait la représentation du jeton CLS, applique une normalisation L2 et distingue les requêtes par un préfixe spécifique. Il fonctionne avec Sentence Transformers, Hugging Face Transformers et Transformers.js.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSnowflake
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie12 avril 2024
Dimension du vecteur1 024
Représentationdense
Paramètres335 millions
Paramètres actifs335 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR56,0 %31ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval42,5 %57ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal35,0 %98ᵉ / 208mteb✅ Mesuré
MTEB: Medical42,3 %57ᵉ / 158mteb✅ Mesuré
MTEB: Legal41,5 %68ᵉ / 157mteb✅ Mesuré
MTEB: European46,6 %82ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French33,9 %83ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German21,0 %116ᵉ / 209mteb✅ Mesuré
MTEB: French50,9 %54ᵉ / 117mteb✅ Mesuré
MTEB: German41,2 %45ᵉ / 96mteb✅ Mesuré
MTEB: Dutch40,7 %67ᵉ / 113mteb✅ Mesuré
MTEB: Indic33,3 %80ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur résultat relatif du modèle apparaît sur BEIR, ce qui en fait principalement un outil de recherche zero-shot sur des tâches et domaines hétérogènes. Ses résultats en Long-context Retrieval et dans les domaines médical et juridique le placent dans une zone intermédiaire des classements MTEB, compatible avec des usages de récupération spécialisée après validation sur les données visées. La licence Apache 2.0 facilite l’auto-hébergement, l’adaptation et l’intégration commerciale. La normalisation L2 simplifie aussi le calcul de similarité entre vecteurs.

Limites et points d'attention. Les résultats French et surtout European sont moins bien classés que BEIR, ce qui invite à évaluer précisément la qualité sur les corpus francophones et européens. Les performances médicales et juridiques restent éloignées des premières places. Avec 1 024 dimensions, chaque vecteur alourdit davantage l’index et les calculs de recherche qu’une représentation de dimension inférieure. Sorti il y a près de deux ans, un âge très long à l’échelle de l’IA, le modèle est probablement dépassé par des références plus récentes et souvent retiré du catalogue de son éditeur. Usages pertinents : recherche sémantique généraliste, récupération pour RAG, similarité et clustering auto-hébergés.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).