voyageai/voyage-code-3
Publié par Voyage AI le 4 décembre 2024, voyageai/voyage-code-3 est un modèle d’embedding dense spécialisé dans la recherche de code. Il produit des vecteurs de 1024 dimensions et prend en charge des dimensions réduites par apprentissage Matryoshka, ainsi que des sorties float, int8 et…
Publié par Voyage AI le 4 décembre 2024, voyageai/voyage-code-3 est un modèle d’embedding dense spécialisé dans la recherche de code. Il produit des vecteurs de 1024 dimensions et prend en charge des dimensions réduites par apprentissage Matryoshka, ainsi que des sorties float, int8 et binaires.
Il sert à indexer et retrouver des fragments de code par similarité sémantique, à alimenter un système RAG ou à regrouper des contenus techniques par proximité. Son déploiement peut passer par l’API Voyage, un VPC avec AWS SageMaker ou une installation sur site.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Voyage AI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 4 décembre 2024 |
| Dimension du vecteur | 1 024 |
| Représentation | dense, avec dimensions réduites Matryoshka et formats de sortie float, int8 et binaire |
| Longueur de séquence max | 32 000 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Code Information Retrieval | 78,5 % | 7ᵉ / 49 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Code Information Retrieval
Notre analyse
Forces. voyageai/voyage-code-3 se distingue en Code Information Retrieval sur MTEB, où il figure dans le top 10. Ce résultat indique une bonne aptitude à rapprocher des requêtes et des éléments de code dans des langages de programmation et des tâches variés. Les dimensions Matryoshka permettent de réduire la taille des vecteurs lorsque l’allègement de l’index est prioritaire. Les formats int8 et binaires offrent aussi des représentations plus compactes que les sorties float. Les options de déploiement couvrent l’accès par API, un environnement VPC sur AWS SageMaker et l’hébergement sur site.
Limites et points d’attention. Le vecteur dense complet de 1024 dimensions produit un index plus lourd et une recherche plus coûteuse que ses représentations réduites ou quantifiées. Présenté comme âgé d’environ deux ans, le modèle appartient à une génération déjà ancienne à l’échelle de l’IA, probablement dépassée par des offres plus récentes et susceptible de ne plus occuper une place centrale dans les catalogues actuels. Usages pertinents : recherche sémantique de code, RAG sur des dépôts logiciels, détection de similarités et clustering de contenus techniques.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).