Snowflake/snowflake-arctic-embed-m-v1.5
Snowflake/snowflake-arctic-embed-m-v1.5 est un modèle d’embedding de 109 millions de paramètres publié par Snowflake le 8 juillet 2024 sous licence ouverte Apache 2.0. Il transforme les textes en vecteurs denses de 768 dimensions et a été évalué sur des corpus anglophones, français,…
Snowflake/snowflake-arctic-embed-m-v1.5 est un modèle d’embedding de 109 millions de paramètres publié par Snowflake le 8 juillet 2024 sous licence ouverte Apache 2.0. Il transforme les textes en vecteurs denses de 768 dimensions et a été évalué sur des corpus anglophones, français, espagnols et européens.
Destiné à la recherche de passages, il utilise le jeton CLS et un préfixe propre aux requêtes. Ses représentations servent à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Les vecteurs peuvent être tronqués puis renormalisés à 256 dimensions, ainsi que quantifiés en int8 ou int4.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Snowflake |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 8 juillet 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense, avec dimensions tronquables et quantification scalaire uniforme int8 ou int4 |
| Paramètres | 109 millions |
| Paramètres actifs | 109 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 55,2 % | 41ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 40,5 % | 67ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 32,8 % | 117ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 40,3 % | 72ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 39,8 % | 81ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 44,1 % | 99ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 28,0 % | 98ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 12,6 % | 161ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 47,2 % | 79ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Spanish | 46,3 % | 27ᵉ / 27 | mteb | ✅ Mesuré |
| MTEB: Dutch | 37,2 % | 82ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: German | 35,5 % | 75ᵉ / 96 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur résultat relatif apparaît sur BEIR, ce qui en fait surtout un modèle adapté à la recherche zero-shot sur des tâches et domaines hétérogènes. Matryoshka Representation Learning permet de réduire les vecteurs de 768 à 256 dimensions, tandis que la quantification scalaire uniforme abaisse leur représentation jusqu’à 128 octets par vecteur en 256 dimensions int4. Ces options allègent les index et peuvent réduire le coût de la recherche. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration avec Sentence Transformers, Hugging Face Transformers ou Transformers.js.
Limites et points d'attention. Les résultats sont moins favorables sur les évaluations linguistiques, particulièrement en espagnol, où le modèle occupe la dernière place du classement indiqué. Les tracks French et European le situent également dans la partie basse de leurs classements. Long-context Retrieval et Medical affichent des performances intermédiaires plutôt qu’un avantage distinctif. Les vecteurs natifs de 768 dimensions restent plus lourds que leur version tronquée, avec un compromis potentiel entre compacité et qualité. Sorti il y a près de deux ans, ce modèle appartient désormais à une génération ancienne à l’échelle de l’IA et peut être dépassé par des embeddings plus récents. Usages pertinents : recherche de passages, RAG et clustering lorsque l’ouverture de la licence et la compression des index sont prioritaires.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).