Snowflake/snowflake-arctic-embed-m-long
Snowflake/snowflake-arctic-embed-m-long est un modèle d’embedding dense publié par Snowflake le 12 avril 2024 sous licence ouverte Apache 2.0. Ses 137 millions de paramètres produisent des vecteurs de 768 dimensions. Fondé sur nomic-ai/nomic-embed-text-v1-unsupervised, il accepte jusqu’à…
Snowflake/snowflake-arctic-embed-m-long est un modèle d’embedding dense publié par Snowflake le 12 avril 2024 sous licence ouverte Apache 2.0. Ses 137 millions de paramètres produisent des vecteurs de 768 dimensions. Fondé sur nomic-ai/nomic-embed-text-v1-unsupervised, il accepte jusqu’à 2 048 tokens sans RPE et 8 192 tokens avec RPE.
Le modèle transforme requêtes et passages en représentations distinctes, avec un préfixe réservé aux requêtes. Via Transformers, l’embedding correspond au vecteur normalisé du token CLS. Il vise la recherche sémantique de passages, l’indexation pour le RAG, la mesure de similarité et le clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Snowflake |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 12 avril 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 137 millions |
| Paramètres actifs | 137 millions |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 54,8 % | 45ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 45,7 % | 50ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 29,4 % | 147ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 38,4 % | 88ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 37,5 % | 99ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 45,7 % | 90ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 29,0 % | 94ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 9,1 % | 179ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB placent le modèle dans la partie supérieure du classement sur BEIR, son track le plus convaincant, ce qui souligne son intérêt pour la recherche zero-shot dans des tâches et domaines variés. Long-context Retrieval constitue également un point fort relatif, cohérent avec la prise en charge de séquences atteignant 8 192 tokens avec RPE. Les vecteurs de 768 dimensions offrent un compromis pratique pour limiter la taille des index face à des représentations plus larges. La licence Apache 2.0 facilite en outre l’auto-hébergement et l’intégration commerciale.
Limites et points d’attention. Les performances sont moins compétitives sur European et Medical, puis reculent davantage sur Legal, particulièrement dans RTEB Legal. Le modèle paraît donc moins adapté aux corpus européens, médicaux ou juridiques exigeant une forte spécialisation. Sorti en 2024, il est ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents, les modèles de cette période étant souvent retirés des catalogues actifs. L’extension à 8 192 tokens dépend de RPE, tandis que le fonctionnement sans RPE reste limité à 2 048 tokens. Usages pertinents : recherche généraliste, RAG sur passages longs, similarité et clustering auto-hébergés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).