voyageai/voyage-finance-2
Publié par Voyage AI le 30 mai 2024, voyageai/voyage-finance-2 est un modèle d’embedding dense qui transforme les textes en vecteurs de 1 024 dimensions. Il sert à mesurer la similarité sémantique entre contenus, sans générer de texte.
Publié par Voyage AI le 30 mai 2024, voyageai/voyage-finance-2 est un modèle d’embedding dense qui transforme les textes en vecteurs de 1 024 dimensions. Il sert à mesurer la similarité sémantique entre contenus, sans générer de texte.
Ses représentations peuvent alimenter un moteur de recherche sémantique, la sélection de passages dans une chaîne RAG ou le clustering de documents. Son évaluation MTEB Scandinavian porte sur des textes en danois, suédois et norvégien bokmål.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Voyage AI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 30 mai 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Longueur de séquence max | 32 000 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Scandinavian | 61,6 % | 14ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Scandinavian
Notre analyse
Forces. Sur MTEB Scandinavian, voyageai/voyage-finance-2 se classe dans le premier tiers des modèles évalués. Ce résultat indique une aptitude notable à représenter la proximité sémantique de textes scandinaves, notamment en danois, suédois et norvégien bokmål. Sa représentation dense de 1 024 dimensions fournit des vecteurs directement exploitables pour classer des résultats, retrouver des passages apparentés ou regrouper des documents selon leur contenu.
Limites et points d’attention. Sa quatorzième place sur 48 dans MTEB Scandinavian reste éloignée des meilleurs résultats de ce benchmark. Les vecteurs de 1 024 dimensions imposent aussi des index plus lourds et davantage de calcul lors des recherches que des représentations de dimension inférieure. Sorti en mai 2024, le modèle atteint environ deux ans d’ancienneté, une durée très longue à l’échelle de l’IA : il appartient à une génération probablement dépassée par des modèles plus récents et susceptible de ne plus occuper une place centrale dans les catalogues actuels. Usages pertinents : recherche sémantique, RAG, similarité et clustering de corpus, notamment scandinaves.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).