Snowflake/snowflake-arctic-embed-l-v2.0

Snowflake/snowflake-arctic-embed-l-v2.0 est un modèle d’embedding multilingue publié par Snowflake le 4 décembre 2024 sous licence ouverte Apache 2.0. Ses 568 millions de paramètres produisent des vecteurs denses de 1 024 dimensions. Construit sur BAAI/bge-m3-retromae, il accepte des…

Snowflake/snowflake-arctic-embed-l-v2.0 est un modèle d’embedding multilingue publié par Snowflake le 4 décembre 2024 sous licence ouverte Apache 2.0. Ses 568 millions de paramètres produisent des vecteurs denses de 1 024 dimensions. Construit sur BAAI/bge-m3-retromae, il accepte des séquences allant jusqu’à 8 192 tokens grâce à RoPE.

Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité et au clustering. Il fonctionne avec Sentence Transformers, Hugging Face Transformers et Transformers.js, avec préfixe de requête et pooling CLS.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSnowflake
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie4 décembre 2024
Dimension du vecteur1 024
Représentationdense
Paramètres568 millions
Paramètres actifs568 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR55,2 %39ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval63,7 %28ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal47,1 %52ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare57,7 %40ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance62,2 %44ᵉ / 97mteb✅ Mesuré
MTEB: Medical59,4 %25ᵉ / 158mteb✅ Mesuré
MTEB: Legal59,0 %15ᵉ / 157mteb✅ Mesuré
MTEB: European58,4 %26ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French53,0 %32ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German65,5 %24ᵉ / 209mteb✅ Mesuré
MTEB: Korean69,7 %8ᵉ / 102mteb✅ Mesuré
MTEB: Indic65,9 %15ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB indiquent une aptitude marquée au traitement multilingue, particulièrement en coréen, où le modèle figure dans le top 10, ainsi que de bonnes capacités sur les langues indiennes. Les évaluations RTEB German montrent une compétence utile pour la recherche en allemand dans les domaines juridique, médical et commercial. Le modèle reste également bien placé en Long-context Retrieval, en cohérence avec sa fenêtre de 8 192 tokens pour indexer et retrouver des informations dans des documents longs. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration commerciale. Matryoshka Representation Learning et la quantification permettent d’envisager une compression des représentations et du modèle.

Limites et points d’attention. Les résultats sont moins compétitifs en russe et surtout sur RTEB Finance, où le classement se situe davantage en milieu de tableau. Les vecteurs denses de 1 024 dimensions alourdissent les index et augmentent le coût de stockage et de recherche par rapport à des représentations plus courtes, même si la compression peut atténuer cet arbitrage. Avec environ deux ans d’ancienneté, ce modèle est ancien à l’échelle de l’IA et probablement dépassé par certains modèles plus récents de sa catégorie. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, similarité textuelle et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).