ByteDance-Seed/Seed1.5-Embedding
ByteDance-Seed/Seed1.5-Embedding est un modèle d’embedding dense publié par ByteDance le 25 avril 2025. Il transforme les textes en vecteurs de 2 048 dimensions, destinés à représenter leur proximité sémantique plutôt qu’à produire du contenu.
ByteDance-Seed/Seed1.5-Embedding est un modèle d’embedding dense publié par ByteDance le 25 avril 2025. Il transforme les textes en vecteurs de 2 048 dimensions, destinés à représenter leur proximité sémantique plutôt qu’à produire du contenu.
Il peut servir à indexer des corpus pour la recherche sémantique, à retrouver des passages dans une architecture RAG, à mesurer la similarité entre textes ou à regrouper des documents par clustering. Ses résultats disponibles le situent notamment sur des contenus en chinois et sur des tâches de retrieval exigeantes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | ByteDance Seed |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 25 avril 2025 |
| Dimension du vecteur | 2 048 |
| Représentation | dense |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Reasoning Retrieval | 27,2 % | 1ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: Chinese | 74,9 % | 5ᵉ / 58 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Reasoning Retrieval
MTEB: Chinese
Notre analyse
Forces. ByteDance-Seed/Seed1.5-Embedding se distingue surtout en retrieval exigeant, avec la première place du track MTEB Reasoning Retrieval parmi 29 modèles évalués. Ce résultat indique une aptitude marquée à retrouver des éléments pertinents pour des requêtes réelles et diverses nécessitant des correspondances sémantiques complexes. Il figure également dans le top 10 de MTEB Chinese, ce qui en fait un candidat solide pour la recherche, le reranking et la classification de paires sur des textes chinois.
Limites et points d’attention. Sa cinquième place sur MTEB Chinese reste moins dominante que son classement en retrieval exigeant. La dimension de 2 048 produit par ailleurs des index plus lourds et des calculs de similarité plus coûteux que des représentations de dimension inférieure, à volume documentaire comparable. Sorti en avril 2025, le modèle approche un an d’ancienneté, une durée très longue dans ce secteur : il doit donc être comparé aux modèles de sa période et peut être dépassé par des solutions plus récentes, voire retiré des catalogues actuels. Usages pertinents : recherche sémantique en chinois, retrieval pour RAG, similarité documentaire et clustering lorsque la qualité prime sur la compacité de l’index.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).