voyageai/voyage-3-large
Publié par Voyage AI le 7 janvier 2025, voyageai/voyage-3-large est un modèle d’embedding dense qui représente chaque texte par un vecteur de 1 024 dimensions. Il couvre notamment le français et l’allemand, en plus d’applications sectorielles évaluées dans la finance, la santé et le droit.
Publié par Voyage AI le 7 janvier 2025, voyageai/voyage-3-large est un modèle d’embedding dense qui représente chaque texte par un vecteur de 1 024 dimensions. Il couvre notamment le français et l’allemand, en plus d’applications sectorielles évaluées dans la finance, la santé et le droit.
Le modèle sert à indexer et rapprocher des contenus selon leur sens, par exemple pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité ou le clustering. Il ne génère pas de texte, mais fournit des représentations numériques exploitables par un moteur de recherche vectorielle.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Voyage AI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 7 janvier 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Longueur de séquence max | 32 000 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 61,0 % | 16ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 68,2 % | 7ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 84,7 % | 5ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 60,5 % | 10ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 70,1 % | 14ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 4,0 % | 18ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB Finance
MTEB: RTEB German
Notre analyse
Forces. Les résultats RTEB placent voyageai/voyage-3-large parmi les modèles les mieux classés pour la recherche d’information financière et médicale. Le modèle se distingue aussi en français, où il figure dans le top 10 sur des tâches couvrant le droit et les connaissances générales. Ses classements en allemand et dans le domaine juridique restent solides, ce qui indique une aptitude au retrieval multilingue et spécialisé. La représentation dense de 1 024 dimensions offre un format unique pour indexer des corpus hétérogènes, calculer des similarités et regrouper des documents.
Limites et points d’attention. Le résultat très faible en Instruction Following montre que le modèle est nettement moins adapté aux recherches dont la pertinence dépend du respect précis d’une consigne. Une dimension de 1 024 augmente aussi le volume des index et le coût des calculs de similarité par rapport à des vecteurs moins dimensionnés. Sorti début 2025 et âgé d’environ deux ans, il appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et susceptible d’être retirée des catalogues. Usages pertinents : recherche sémantique et RAG sur des corpus financiers, médicaux, juridiques, français ou allemands, ainsi que clustering documentaire.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).