Bytedance/Seed1.6-embedding-1215
Publié par ByteDance le 15 décembre 2025, Bytedance/Seed1.6-embedding-1215 est un modèle d’embedding dense. Il convertit chaque texte en un vecteur de 2 048 dimensions, destiné à représenter son contenu sous une forme numérique comparable et indexable.
Publié par ByteDance le 15 décembre 2025, Bytedance/Seed1.6-embedding-1215 est un modèle d’embedding dense. Il convertit chaque texte en un vecteur de 2 048 dimensions, destiné à représenter son contenu sous une forme numérique comparable et indexable.
Cette représentation convient à la recherche sémantique, à la sélection de passages pour les systèmes RAG, au calcul de similarité et au regroupement de contenus par clustering. Le modèle sert ainsi à retrouver ou organiser des textes selon leur proximité sémantique, sans produire lui-même de réponse textuelle.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | ByteDance |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 15 décembre 2025 |
| Dimension du vecteur | 2 048 |
| Représentation | dense |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Code Information Retrieval | 78,3 % | 9ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 80,7 % | 3ᵉ / 43 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Code Information Retrieval
MTEB: Code
Notre analyse
Forces. Les résultats MTEB placent le modèle parmi les dix premiers sur les deux évaluations consacrées à la recherche dans des corpus de programmation. Il se distingue donc dans l’association entre requêtes et contenus techniques pertinents, sur plusieurs langages et différentes tâches de recherche d’information. Cette spécialisation peut soutenir l’indexation sémantique de dépôts, de documentation technique ou de collections de fragments structurés. La représentation dense favorise les comparaisons de proximité, tandis que les résultats disponibles reposent sur deux sources de données concordantes.
Limites et points d'attention. Le modèle se situe nettement plus bas sur le track MTEB Instruction Following, avec un résultat proche de zéro et un classement hors des premières places. Il paraît donc moins adapté aux systèmes de retrieval dans lesquels une consigne détaillée doit modifier précisément les critères de sélection. Les vecteurs de 2 048 dimensions impliquent aussi des index plus volumineux et davantage de calcul lors des recherches qu’avec des représentations de dimension inférieure. Usages pertinents : recherche sémantique technique, sélection de passages pour le RAG, détection de similarités et clustering de corpus spécialisés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).