TencentBAC/Conan-embedding-v1
TencentBAC/Conan-embedding-v1 est un modèle d’embedding généraliste publié par Tencent le 22 août 2024. Ses 326 millions de paramètres produisent des représentations denses de 768 dimensions. Distribué sous licence CC-BY-NC 4.0, il peut être réutilisé et auto-hébergé dans un cadre non…
TencentBAC/Conan-embedding-v1 est un modèle d’embedding généraliste publié par Tencent le 22 août 2024. Ses 326 millions de paramètres produisent des représentations denses de 768 dimensions. Distribué sous licence CC-BY-NC 4.0, il peut être réutilisé et auto-hébergé dans un cadre non commercial, sous réserve d’attribution.
Le modèle transforme les textes en vecteurs destinés à la recherche sémantique, à l’indexation pour le RAG, au clustering et au calcul de similarité. Il a également été évalué pour la classification, le reranking et la classification par paires. Son entraînement met l’accent sur l’emploi d’échantillons négatifs plus nombreux et de meilleure qualité.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Tencent |
| Poids | 🟢 Poids ouverts |
| Licence | CC-BY-NC 4.0 |
| Date de sortie | 22 août 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 326 millions |
| Paramètres actifs | 326 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Chinese | 72,5 % | 11ᵉ / 58 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Chinese
Notre analyse
Forces. TencentBAC/Conan-embedding-v1 se place dans le groupe de tête du benchmark MTEB Chinese, qui couvre notamment la recherche, le reranking et la classification par paires. Ce résultat en fait surtout une option crédible pour représenter et retrouver des contenus chinois, ainsi que pour regrouper des textes ou mesurer leur proximité sémantique. La sortie dense de 768 dimensions offre un compromis pratique entre richesse de représentation et taille des index. La licence CC-BY-NC 4.0 autorise par ailleurs le déploiement autonome, l’adaptation et l’expérimentation hors usages commerciaux.
Limites et points d’attention. Sorti en août 2024, le modèle approche deux ans, une ancienneté importante dans un domaine où les références évoluent rapidement. Son classement, favorable sans être dominant, le situe derrière plusieurs concurrents sur l’évaluation chinoise globale. Les vecteurs denses de 768 dimensions entraînent aussi davantage de stockage et de calcul qu’une représentation plus compacte. Surtout, la clause non commerciale de la licence restreint son intégration dans des produits ou services marchands. Usages pertinents : recherche sémantique en chinois, RAG non commercial, clustering, reranking et analyse de similarité textuelle.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).