Bytedance/Seed1.6-embedding

Publié par ByteDance le 18 juin 2025, Bytedance/Seed1.6-embedding est un modèle d’embedding dense qui transforme les textes en vecteurs de 2 048 dimensions. Cette représentation numérique sert à mesurer la proximité sémantique entre des requêtes, des passages ou des documents.

Publié par ByteDance le 18 juin 2025, Bytedance/Seed1.6-embedding est un modèle d’embedding dense qui transforme les textes en vecteurs de 2 048 dimensions. Cette représentation numérique sert à mesurer la proximité sémantique entre des requêtes, des passages ou des documents.

Le modèle peut alimenter un moteur de recherche sémantique, la sélection de passages dans un système RAG, le regroupement de contenus par thèmes et la détection de textes similaires. Son évaluation disponible porte sur des textes chinois et couvre notamment la recherche, le reranking et la classification de paires.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurByteDance
Poids🟢 Poids ouverts
Date de sortie18 juin 2025
Dimension du vecteur2 048
Représentationdense
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text,image → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Chinese75,6 %4ᵉ / 58mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Chinese

▶ Bytedance/Seed1.6-embed…76 %

Notre analyse

Forces. Bytedance/Seed1.6-embedding se classe dans le top 10 de MTEB: Chinese, ce qui le situe parmi les modèles les plus performants de cette évaluation pour la représentation de textes chinois. Le benchmark couvre plusieurs usages complémentaires, notamment le retrieval, le reranking et la pair classification. Cette polyvalence le rend adapté à l’indexation sémantique, à la sélection de passages pour le RAG, au rapprochement de contenus et au clustering. La représentation dense favorise une comparaison directe des textes par proximité vectorielle.

Limites et points d'attention. Les vecteurs de 2 048 dimensions augmentent la taille des index, la consommation de mémoire et le coût des recherches par rapport à des représentations moins dimensionnelles. Des techniques de réduction de dimension ou de quantification peuvent donc devenir nécessaires lorsque le corpus est volumineux, avec un compromis potentiel sur la qualité. Âgé d’environ un an, ce modèle appartient déjà à une génération ancienne à l’échelle de l’IA, probablement dépassée par des embeddings plus récents et susceptible d’avoir quitté le catalogue actif de l’éditeur. Usages pertinents : recherche sémantique en chinois, RAG, similarité documentaire, reranking, classification de paires et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).