TencentBAC/Conan-embedding-v2

TencentBAC/Conan-embedding-v2 est un modèle d’embedding dense publié par Tencent le 10 avril 2025 sous licence ouverte Apache 2.0. Fondé sur Conan-1.4B, entraîné spécifiquement pour l’embedding, il produit des vecteurs de 3 584 dimensions et accepte des séquences atteignant 32 768 tokens.

TencentBAC/Conan-embedding-v2 est un modèle d’embedding dense publié par Tencent le 10 avril 2025 sous licence ouverte Apache 2.0. Fondé sur Conan-1.4B, entraîné spécifiquement pour l’embedding, il produit des vecteurs de 3 584 dimensions et accepte des séquences atteignant 32 768 tokens.

Son tokenizer BBPE multilingue comprend un vocabulaire de 150 000 entrées. Le modèle prend notamment en charge la recherche cross-lingue entre textes chinois et anglais. Il sert à indexer des documents pour la recherche sémantique et le RAG, ainsi qu’à mesurer des similarités ou constituer des groupes de contenus.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurTencent
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie10 avril 2025
Dimension du vecteur3 584
Représentationdense
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR66,4 %2ᵉ / 192mteb✅ Mesuré
MTEB: Chinese74,2 %6ᵉ / 58mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ TencentBAC/Conan-embedd…66 %

MTEB: Chinese

▶ TencentBAC/Conan-embedd…74 %

Notre analyse

Forces. Conan-embedding-v2 se distingue surtout en recherche d’information. Son classement parmi les meilleurs sur BEIR indique une forte aptitude au retrieval zero-shot dans des tâches et domaines hétérogènes. Ses résultats sur MTEB Chinese le placent également dans le groupe de tête pour les textes chinois, sur des tâches couvrant la recherche, le reranking et la classification de paires. La recherche cross-lingue chinois-anglais favorise le rapprochement de contenus entre ces deux langues. Le contexte de 32 768 tokens facilite l’encodage de documents longs. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes commerciaux.

Limites et points d’attention. Les vecteurs denses de 3 584 dimensions alourdissent les index, augmentent les besoins de stockage et rendent la recherche de similarité plus coûteuse que des représentations plus compactes. Sorti il y a environ un an, le modèle est déjà ancien à l’échelle de l’IA et peut être dépassé par des embeddings plus récents de sa catégorie. Son orientation cross-lingue explicitement établie concerne le chinois et l’anglais. Usages pertinents : recherche sémantique et RAG sur des corpus chinois, anglais ou bilingues, rapprochement de documents longs, similarité et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).