Snowflake/snowflake-arctic-embed-xs
Snowflake/snowflake-arctic-embed-xs est un modèle d’embedding dense publié par Snowflake le 8 juillet 2024 sous licence ouverte Apache 2.0. Ses 23 millions de paramètres produisent des vecteurs de 384 dimensions, un format compact adapté à la constitution d’index vectoriels.
Snowflake/snowflake-arctic-embed-xs est un modèle d’embedding dense publié par Snowflake le 8 juillet 2024 sous licence ouverte Apache 2.0. Ses 23 millions de paramètres produisent des vecteurs de 384 dimensions, un format compact adapté à la constitution d’index vectoriels.
Fondé sur all-MiniLM-L6-v2, il transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Son entraînement pour la recherche combine des paires requête-document puis des triplets intégrant des négatifs difficiles. Il fonctionne avec Sentence Transformers, Hugging Face Transformers et Transformers.js.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Snowflake |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 8 juillet 2024 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 23 millions |
| Paramètres actifs | 23 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 50,1 % | 98ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 36,8 % | 94ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 28,9 % | 150ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 34,3 % | 101ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 35,7 % | 111ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 43,4 % | 103ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 16,1 % | 142ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 9,7 % | 177ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 43,9 % | 89ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 35,5 % | 74ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 35,1 % | 89ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Indic | 32,7 % | 84ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Son meilleur résultat relatif apparaît sur BEIR, consacré à la recherche zero-shot dans des tâches et domaines hétérogènes, même si son classement reste proche du milieu du panel évalué. L’entraînement orienté retrieval et l’emploi d’un préfixe réservé aux requêtes répondent directement aux besoins d’appariement entre questions et documents. Avec Transformers, la représentation repose sur le jeton CLS normalisé. Les vecteurs de 384 dimensions permettent des index plus légers que ceux produits par des embeddings de grande dimension. La licence Apache 2.0 facilite l’auto-hébergement, l’intégration et l’adaptation.
Limites et points d’attention. Les évaluations French et European le placent dans la partie basse de leurs classements, tandis que German est également en retrait. Les résultats sont plus faibles encore en proportion sur Long-context Retrieval et Legal, ce qui réduit son intérêt pour les documents longs et la recherche juridique spécialisée. Sorti en 2024, il est ancien à l’échelle rapide de l’IA et probablement dépassé par des modèles plus récents de même catégorie. Usages pertinents : recherche sémantique généraliste, RAG compact, similarité de textes et clustering lorsque la légèreté de l’index et l’auto-hébergement priment.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).