Snowflake/snowflake-arctic-embed-l
Snowflake/snowflake-arctic-embed-l est un modèle d’embedding dense publié par Snowflake le 12 avril 2024 sous licence ouverte Apache 2.0. Fondé sur intfloat/e5-large-unsupervised, il compte 335 millions de paramètres, tous actifs, et transforme chaque texte en un vecteur de 1 024…
Snowflake/snowflake-arctic-embed-l est un modèle d’embedding dense publié par Snowflake le 12 avril 2024 sous licence ouverte Apache 2.0. Fondé sur intfloat/e5-large-unsupervised, il compte 335 millions de paramètres, tous actifs, et transforme chaque texte en un vecteur de 1 024 dimensions.
Le modèle est conçu pour la correspondance entre requêtes et documents, notamment en recherche sémantique, en récupération documentaire pour le RAG, en mesure de similarité et en clustering. Il extrait la représentation du jeton CLS, applique une normalisation L2 et distingue les requêtes par un préfixe spécifique. Il fonctionne avec Sentence Transformers, Hugging Face Transformers et Transformers.js.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Snowflake |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 12 avril 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 335 millions |
| Paramètres actifs | 335 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 56,0 % | 31ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 42,5 % | 57ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 35,0 % | 98ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 42,3 % | 57ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 41,5 % | 68ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 46,6 % | 82ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 33,9 % | 83ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 21,0 % | 116ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 50,9 % | 54ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 41,2 % | 45ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 40,7 % | 67ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Indic | 33,3 % | 80ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur résultat relatif du modèle apparaît sur BEIR, ce qui en fait principalement un outil de recherche zero-shot sur des tâches et domaines hétérogènes. Ses résultats en Long-context Retrieval et dans les domaines médical et juridique le placent dans une zone intermédiaire des classements MTEB, compatible avec des usages de récupération spécialisée après validation sur les données visées. La licence Apache 2.0 facilite l’auto-hébergement, l’adaptation et l’intégration commerciale. La normalisation L2 simplifie aussi le calcul de similarité entre vecteurs.
Limites et points d'attention. Les résultats French et surtout European sont moins bien classés que BEIR, ce qui invite à évaluer précisément la qualité sur les corpus francophones et européens. Les performances médicales et juridiques restent éloignées des premières places. Avec 1 024 dimensions, chaque vecteur alourdit davantage l’index et les calculs de recherche qu’une représentation de dimension inférieure. Sorti il y a près de deux ans, un âge très long à l’échelle de l’IA, le modèle est probablement dépassé par des références plus récentes et souvent retiré du catalogue de son éditeur. Usages pertinents : recherche sémantique généraliste, récupération pour RAG, similarité et clustering auto-hébergés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).