Snowflake/snowflake-arctic-embed-m-v2.0
Snowflake/snowflake-arctic-embed-m-v2.0 est un modèle d’embedding multilingue de Snowflake, publié sous licence ouverte Apache 2.0. Ses 305 millions de paramètres produisent des vecteurs denses de 768 dimensions. Construit sur GTE-multilingual-base, il accepte jusqu’à 8 192 jetons grâce…
Snowflake/snowflake-arctic-embed-m-v2.0 est un modèle d’embedding multilingue de Snowflake, publié sous licence ouverte Apache 2.0. Ses 305 millions de paramètres produisent des vecteurs denses de 768 dimensions. Construit sur GTE-multilingual-base, il accepte jusqu’à 8 192 jetons grâce à RoPE.
Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité et au clustering. Il exploite le jeton CLS et applique un préfixe spécifique aux requêtes. Matryoshka Representation Learning permet aussi de tronquer les vecteurs à 256 dimensions.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Snowflake |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 4 décembre 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense, avec réduction dimensionnelle par Matryoshka Representation Learning et quantification 4 bits |
| Paramètres | 305 millions |
| Paramètres actifs | 305 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 55,5 % | 35ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 55,4 % | 40ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 47,3 % | 51ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 57,3 % | 30ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 56,6 % | 21ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 55,5 % | 37ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 49,9 % | 48ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 58,0 % | 45ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Korean | 60,8 % | 21ᵉ / 102 | mteb | ✅ Mesuré |
| MTEB: Indic | 59,4 % | 31ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Dutch | 50,3 % | 43ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB placent surtout le modèle favorablement sur les corpus coréens et juridiques, avec des positions également solides en recherche médicale et dans les langues indiciennes. Cette couverture convient aux systèmes de récupération multilingues et aux corpus spécialisés, notamment cliniques, biomédicaux, juridiques et réglementaires. La fenêtre de 8 192 jetons facilite l’encodage de documents longs. La réduction Matryoshka à 256 dimensions et l’entraînement tenant compte de la quantification 4 bits peuvent alléger le stockage des index et accélérer la recherche. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d’attention. Les positions sont moins favorables sur RTEB German et sur le track MTEB European, ce qui invite à valider la qualité langue par langue et domaine par domaine. Les vecteurs complets de 768 dimensions alourdissent davantage les index et les calculs de similarité que leur version tronquée, tandis que la réduction dimensionnelle et la quantification impliquent un arbitrage entre compacité et qualité. Sorti le 4 décembre 2024, ce modèle âgé d’environ deux ans est ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents et souvent retiré du catalogue de l’éditeur. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, recherche juridique ou médicale et clustering de corpus.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).