tencent/Youtu-Embedding

tencent/Youtu-Embedding est un modèle d’embedding texte généraliste de Tencent, publié le 28 septembre 2025 sous licence ouverte Apache 2.0. Ses 3 milliards de paramètres actifs produisent des représentations denses de 2 048 dimensions, avec une longueur de séquence de 8K.

tencent/Youtu-Embedding est un modèle d’embedding texte généraliste de Tencent, publié le 28 septembre 2025 sous licence ouverte Apache 2.0. Ses 3 milliards de paramètres actifs produisent des représentations denses de 2 048 dimensions, avec une longueur de séquence de 8K.

Le modèle transforme requêtes et documents en vecteurs normalisés afin d’alimenter la recherche sémantique, la récupération de contexte pour le RAG, la mesure de similarité et le clustering. Il prend aussi en charge le reranking et la classification, avec encodage guidé par instruction, mean pooling et intégrations dans transformers, sentence-transformers, LangChain et LlamaIndex.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurTencent
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie28 septembre 2025
Dimension du vecteur2 048
Représentationdense
Paramètres3 milliards
Paramètres actifs3 milliards
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Chinese77,6 %2ᵉ / 58mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Chinese

▶ tencent/Youtu-Embedding78 %

Notre analyse

Forces. tencent/Youtu-Embedding se classe parmi les meilleurs modèles évalués par MTEB: Chinese, un ensemble couvrant notamment la recherche d’information, le reranking et la classification de paires en chinois. Cette position en fait un candidat solide pour rapprocher des requêtes et des documents selon leur sens, regrouper des contenus similaires ou sélectionner des passages destinés à un pipeline RAG. Son contexte de 8K facilite l’encodage de textes relativement longs. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales, tandis que les compatibilités annoncées avec plusieurs bibliothèques courantes simplifient son déploiement.

Limites et points d'attention. Les vecteurs denses de 2 048 dimensions augmentent la taille des index, la consommation de mémoire et le coût des calculs de similarité par rapport à des représentations moins dimensionnelles. Les 3 milliards de paramètres étant tous actifs, l’inférence mobilise l’ensemble du modèle, ce qui alourdit également les besoins de déploiement. Les usages pertinents sont la recherche sémantique en chinois, le RAG, le reranking, la classification de paires et le clustering de documents.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).