Bytedance/Seed1.6-embedding
Publié par ByteDance le 18 juin 2025, Bytedance/Seed1.6-embedding est un modèle d’embedding dense qui transforme les textes en vecteurs de 2 048 dimensions. Cette représentation numérique sert à mesurer la proximité sémantique entre des requêtes, des passages ou des documents.
Publié par ByteDance le 18 juin 2025, Bytedance/Seed1.6-embedding est un modèle d’embedding dense qui transforme les textes en vecteurs de 2 048 dimensions. Cette représentation numérique sert à mesurer la proximité sémantique entre des requêtes, des passages ou des documents.
Le modèle peut alimenter un moteur de recherche sémantique, la sélection de passages dans un système RAG, le regroupement de contenus par thèmes et la détection de textes similaires. Son évaluation disponible porte sur des textes chinois et couvre notamment la recherche, le reranking et la classification de paires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | ByteDance |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 18 juin 2025 |
| Dimension du vecteur | 2 048 |
| Représentation | dense |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | text,image → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Chinese | 75,6 % | 4ᵉ / 58 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Chinese
Notre analyse
Forces. Bytedance/Seed1.6-embedding se classe dans le top 10 de MTEB: Chinese, ce qui le situe parmi les modèles les plus performants de cette évaluation pour la représentation de textes chinois. Le benchmark couvre plusieurs usages complémentaires, notamment le retrieval, le reranking et la pair classification. Cette polyvalence le rend adapté à l’indexation sémantique, à la sélection de passages pour le RAG, au rapprochement de contenus et au clustering. La représentation dense favorise une comparaison directe des textes par proximité vectorielle.
Limites et points d'attention. Les vecteurs de 2 048 dimensions augmentent la taille des index, la consommation de mémoire et le coût des recherches par rapport à des représentations moins dimensionnelles. Des techniques de réduction de dimension ou de quantification peuvent donc devenir nécessaires lorsque le corpus est volumineux, avec un compromis potentiel sur la qualité. Âgé d’environ un an, ce modèle appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par des embeddings plus récents et susceptible d’avoir quitté le catalogue actif de l’éditeur. Usages pertinents : recherche sémantique en chinois, RAG, similarité documentaire, reranking, classification de paires et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).