voyageai/voyage-3-m-exp
Publié par Voyage AI le 8 janvier 2025, voyageai/voyage-3-m-exp est un modèle d’embedding généraliste de 7 milliards de paramètres. Cet instantané intermédiaire transforme les textes en vecteurs de 2 048 dimensions et accepte des séquences allant jusqu’à 32 000 éléments de contexte.
Publié par Voyage AI le 8 janvier 2025, voyageai/voyage-3-m-exp est un modèle d’embedding généraliste de 7 milliards de paramètres. Cet instantané intermédiaire transforme les textes en vecteurs de 2 048 dimensions et accepte des séquences allant jusqu’à 32 000 éléments de contexte.
Accessible via l’API Voyage sous le nom « voyage-3-m-exp », il sert à indexer des contenus pour la recherche sémantique, à retrouver des passages dans un système RAG, à mesurer la similarité entre textes et à constituer des groupes thématiques. Des invites distinctes adaptent l’encodage aux requêtes et aux documents.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Voyage AI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 8 janvier 2025 |
| Dimension du vecteur | 2 048 |
| Représentation | embedding vectoriel de 2 048 dimensions |
| Paramètres | 7 milliards |
| Paramètres actifs | 7 milliards |
| Longueur de séquence max | 32 000 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 68,1 % | 1ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. voyageai/voyage-3-m-exp se distingue surtout en recherche d’information zero-shot sur BEIR, où il figure au premier rang parmi 192 modèles évalués. Ce résultat couvre un ensemble hétérogène de tâches et de domaines, ce qui soutient son positionnement généraliste pour le retrieval. Son évaluation MTEB emploie aussi des invites propres à la similarité, à la classification, au clustering, au réordonnancement et à la recherche. Le contexte de 32 000 facilite l’encodage de documents longs, tandis que les invites séparées pour requêtes et documents correspondent directement aux architectures de recherche sémantique et de RAG.
Limites et points d’attention. Les vecteurs de 2 048 dimensions alourdissent les index et rendent le stockage ainsi que la recherche plus coûteux que des représentations plus compactes. Le modèle est un instantané intermédiaire, adapté à des données similaires à MTEB et entraîné avec les ensembles d’entraînement de MTEB, ce qui invite à compléter ce benchmark par des essais sur les corpus réellement ciblés. Âgé d’environ deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA, probablement dépassée et souvent retirée des catalogues actuels. Usages pertinents : recherche documentaire, retrieval pour RAG, similarité, réordonnancement et clustering de textes, notamment avec des documents longs.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).