TencentBAC/Conan-embedding-v1

TencentBAC/Conan-embedding-v1 est un modèle d’embedding généraliste publié par Tencent le 22 août 2024. Ses 326 millions de paramètres produisent des représentations denses de 768 dimensions. Distribué sous licence CC-BY-NC 4.0, il peut être réutilisé et auto-hébergé dans un cadre non…

TencentBAC/Conan-embedding-v1 est un modèle d’embedding généraliste publié par Tencent le 22 août 2024. Ses 326 millions de paramètres produisent des représentations denses de 768 dimensions. Distribué sous licence CC-BY-NC 4.0, il peut être réutilisé et auto-hébergé dans un cadre non commercial, sous réserve d’attribution.

Le modèle transforme les textes en vecteurs destinés à la recherche sémantique, à l’indexation pour le RAG, au clustering et au calcul de similarité. Il a également été évalué pour la classification, le reranking et la classification par paires. Son entraînement met l’accent sur l’emploi d’échantillons négatifs plus nombreux et de meilleure qualité.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurTencent
Poids🟢 Poids ouverts
LicenceCC-BY-NC 4.0
Date de sortie22 août 2024
Dimension du vecteur768
Représentationdense
Paramètres326 millions
Paramètres actifs326 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Chinese72,5 %11ᵉ / 58mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Chinese

▶ TencentBAC/Conan-embedd…72 %
lier007/xiaobu-embeddin…72 %

Notre analyse

Forces. TencentBAC/Conan-embedding-v1 se place dans le groupe de tête du benchmark MTEB Chinese, qui couvre notamment la recherche, le reranking et la classification par paires. Ce résultat en fait surtout une option crédible pour représenter et retrouver des contenus chinois, ainsi que pour regrouper des textes ou mesurer leur proximité sémantique. La sortie dense de 768 dimensions offre un compromis pratique entre richesse de représentation et taille des index. La licence CC-BY-NC 4.0 autorise par ailleurs le déploiement autonome, l’adaptation et l’expérimentation hors usages commerciaux.

Limites et points d’attention. Sorti en août 2024, le modèle approche deux ans, une ancienneté importante dans un domaine où les références évoluent rapidement. Son classement, favorable sans être dominant, le situe derrière plusieurs concurrents sur l’évaluation chinoise globale. Les vecteurs denses de 768 dimensions entraînent aussi davantage de stockage et de calcul qu’une représentation plus compacte. Surtout, la clause non commerciale de la licence restreint son intégration dans des produits ou services marchands. Usages pertinents : recherche sémantique en chinois, RAG non commercial, clustering, reranking et analyse de similarité textuelle.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).