Cohere/Cohere-embed-english-v3.0

Publié par Cohere le 2 novembre 2023, Cohere/Cohere-embed-english-v3.0 est un modèle d’embedding anglophone dense, entraîné sur près d’un milliard de paires en anglais. Il convertit chaque texte en un vecteur de 1 024 dimensions.

Publié par Cohere le 2 novembre 2023, Cohere/Cohere-embed-english-v3.0 est un modèle d’embedding anglophone dense, entraîné sur près d’un milliard de paires en anglais. Il convertit chaque texte en un vecteur de 1 024 dimensions.

Le modèle sert à indexer des documents pour la recherche sémantique, alimenter la récupération d’un système RAG, mesurer la similarité ou réaliser du clustering. Il distingue les documents, avec « search_document », des requêtes, avec « search_query ». Son exploitation passe par l’API Cohere, AWS SageMaker ou un déploiement privé.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurCohere
Poids🟢 Poids ouverts
Date de sortie2 novembre 2023
Dimension du vecteur1 024
Représentationdense
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval42,1 %60ᵉ / 170mteb✅ Mesuré
MTEB: Reasoning Retrieval16,3 %13ᵉ / 29mteb✅ Mesuré
MTEB: RTEB Legal36,6 %90ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare48,0 %54ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance51,4 %67ᵉ / 97mteb✅ Mesuré
MTEB: Medical45,3 %51ᵉ / 158mteb✅ Mesuré
MTEB: Legal43,1 %58ᵉ / 157mteb✅ Mesuré
MTEB: European52,2 %45ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French34,6 %81ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German25,8 %106ᵉ / 209mteb✅ Mesuré
MTEB: French54,5 %38ᵉ / 117mteb✅ Mesuré
MTEB: Indic37,2 %53ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Long-context Retrieval

▶ Cohere/Cohere-embed-eng…42 %
manveertamber/cadet-emb…42 %

MTEB: Reasoning Retrieval

▶ Cohere/Cohere-embed-eng…16 %
manveertamber/cadet-emb…15 %

Notre analyse

Forces. Les résultats MTEB les plus favorables concernent les évaluations French et European, où le modèle se situe dans la partie supérieure du classement malgré un entraînement annoncé en anglais. RTEB Finance constitue son meilleur résultat parmi les domaines spécialisés évalués, devant la santé, le médical et le juridique. La séparation explicite entre documents et requêtes adapte les vecteurs aux deux rôles d’un moteur de recherche sémantique. Les options d’exploitation couvrent un service hébergé, une intégration AWS SageMaker et un déploiement privé.

Limites et points d’attention. Les performances reculent sur les corpus spécialisés, particulièrement en recherche juridique et médicale, où le modèle reste en milieu de tableau. Le vecteur dense de 1 024 dimensions implique un index plus volumineux et davantage de calcul qu’une représentation de dimension inférieure. Sorti il y a environ trois ans, il est très ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents et susceptible d’avoir été retiré de certains catalogues. Usages pertinents : recherche sémantique principalement anglophone, récupération pour RAG, similarité documentaire et clustering, avec validation spécifique indispensable en finance, santé, médecine et droit.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).