Snowflake/snowflake-arctic-embed-m-v2.0

Snowflake/snowflake-arctic-embed-m-v2.0 est un modèle d’embedding multilingue de Snowflake, publié sous licence ouverte Apache 2.0. Ses 305 millions de paramètres produisent des vecteurs denses de 768 dimensions. Construit sur GTE-multilingual-base, il accepte jusqu’à 8 192 jetons grâce…

Snowflake/snowflake-arctic-embed-m-v2.0 est un modèle d’embedding multilingue de Snowflake, publié sous licence ouverte Apache 2.0. Ses 305 millions de paramètres produisent des vecteurs denses de 768 dimensions. Construit sur GTE-multilingual-base, il accepte jusqu’à 8 192 jetons grâce à RoPE.

Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité et au clustering. Il exploite le jeton CLS et applique un préfixe spécifique aux requêtes. Matryoshka Representation Learning permet aussi de tronquer les vecteurs à 256 dimensions.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSnowflake
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie4 décembre 2024
Dimension du vecteur768
Représentationdense, avec réduction dimensionnelle par Matryoshka Representation Learning et quantification 4 bits
Paramètres305 millions
Paramètres actifs305 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR55,5 %35ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval55,4 %40ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal47,3 %51ᵉ / 208mteb✅ Mesuré
MTEB: Medical57,3 %30ᵉ / 158mteb✅ Mesuré
MTEB: Legal56,6 %21ᵉ / 157mteb✅ Mesuré
MTEB: European55,5 %37ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French49,9 %48ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German58,0 %45ᵉ / 209mteb✅ Mesuré
MTEB: Korean60,8 %21ᵉ / 102mteb✅ Mesuré
MTEB: Indic59,4 %31ᵉ / 119mteb✅ Mesuré
MTEB: Dutch50,3 %43ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ Snowflake/snowflake-arc…55 %

MTEB: Long-context Retrieval

▶ Snowflake/snowflake-arc…55 %
dwzhu/e5-base-4k55 %

Notre analyse

Forces. Les résultats MTEB placent surtout le modèle favorablement sur les corpus coréens et juridiques, avec des positions également solides en recherche médicale et dans les langues indiciennes. Cette couverture convient aux systèmes de récupération multilingues et aux corpus spécialisés, notamment cliniques, biomédicaux, juridiques et réglementaires. La fenêtre de 8 192 jetons facilite l’encodage de documents longs. La réduction Matryoshka à 256 dimensions et l’entraînement tenant compte de la quantification 4 bits peuvent alléger le stockage des index et accélérer la recherche. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d’attention. Les positions sont moins favorables sur RTEB German et sur le track MTEB European, ce qui invite à valider la qualité langue par langue et domaine par domaine. Les vecteurs complets de 768 dimensions alourdissent davantage les index et les calculs de similarité que leur version tronquée, tandis que la réduction dimensionnelle et la quantification impliquent un arbitrage entre compacité et qualité. Sorti le 4 décembre 2024, ce modèle âgé d’environ deux ans est ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents et souvent retiré du catalogue de l’éditeur. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, recherche juridique ou médicale et clustering de corpus.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).