Snowflake/snowflake-arctic-embed-l-v2.0
Snowflake/snowflake-arctic-embed-l-v2.0 est un modèle d’embedding multilingue publié par Snowflake le 4 décembre 2024 sous licence ouverte Apache 2.0. Ses 568 millions de paramètres produisent des vecteurs denses de 1 024 dimensions. Construit sur BAAI/bge-m3-retromae, il accepte des…
Snowflake/snowflake-arctic-embed-l-v2.0 est un modèle d’embedding multilingue publié par Snowflake le 4 décembre 2024 sous licence ouverte Apache 2.0. Ses 568 millions de paramètres produisent des vecteurs denses de 1 024 dimensions. Construit sur BAAI/bge-m3-retromae, il accepte des séquences allant jusqu’à 8 192 tokens grâce à RoPE.
Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité et au clustering. Il fonctionne avec Sentence Transformers, Hugging Face Transformers et Transformers.js, avec préfixe de requête et pooling CLS.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Snowflake |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 4 décembre 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 568 millions |
| Paramètres actifs | 568 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 55,2 % | 39ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 63,7 % | 28ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 47,1 % | 52ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 57,7 % | 40ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 62,2 % | 44ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 59,4 % | 25ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 59,0 % | 15ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 58,4 % | 26ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 53,0 % | 32ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 65,5 % | 24ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Korean | 69,7 % | 8ᵉ / 102 | mteb | ✅ Mesuré |
| MTEB: Indic | 65,9 % | 15ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB indiquent une aptitude marquée au traitement multilingue, particulièrement en coréen, où le modèle figure dans le top 10, ainsi que de bonnes capacités sur les langues indiennes. Les évaluations RTEB German montrent une compétence utile pour la recherche en allemand dans les domaines juridique, médical et commercial. Le modèle reste également bien placé en Long-context Retrieval, en cohérence avec sa fenêtre de 8 192 tokens pour indexer et retrouver des informations dans des documents longs. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration commerciale. Matryoshka Representation Learning et la quantification permettent d’envisager une compression des représentations et du modèle.
Limites et points d’attention. Les résultats sont moins compétitifs en russe et surtout sur RTEB Finance, où le classement se situe davantage en milieu de tableau. Les vecteurs denses de 1 024 dimensions alourdissent les index et augmentent le coût de stockage et de recherche par rapport à des représentations plus courtes, même si la compression peut atténuer cet arbitrage. Avec environ deux ans d’ancienneté, ce modèle est ancien à l’échelle de l’IA et probablement dépassé par certains modèles plus récents de sa catégorie. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, similarité textuelle et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).