bedrock/cohere-embed-english-v3

bedrock/cohere-embed-english-v3 est un modèle d’embedding dense publié par bedrock le 2 novembre 2023. Il transforme les textes en vecteurs de 1 024 dimensions, destinés à représenter leur proximité sémantique plutôt qu’à produire du contenu.

bedrock/cohere-embed-english-v3 est un modèle d’embedding dense publié par bedrock le 2 novembre 2023. Il transforme les textes en vecteurs de 1 024 dimensions, destinés à représenter leur proximité sémantique plutôt qu’à produire du contenu.

Ces représentations peuvent alimenter un moteur de recherche sémantique, la sélection de passages pour un système RAG, le calcul de similarité ou le regroupement de documents par clustering. Avec environ trois ans d’ancienneté, le modèle appartient désormais à une génération ancienne à l’échelle de l’IA, probablement dépassée par des solutions plus récentes et susceptible d’avoir été retirée des catalogues actuels.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurbedrock
Poids🟢 Poids ouverts
Date de sortie2 novembre 2023
Dimension du vecteur1 024
Représentationdense
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Chemical72,9 %9ᵉ / 41mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. bedrock/cohere-embed-english-v3 se classe dans le top 10 du benchmark MTEB consacré au domaine chimique. Ce résultat indique une bonne qualité de représentation des textes spécialisés de ce secteur, sur un ensemble couvrant notamment le bitext mining, la classification et le clustering. Le format dense de 1 024 dimensions fournit une représentation vectorielle directement exploitable dans des index de recherche sémantique et des pipelines de rapprochement documentaire.

Limites et points d’attention. Son positionnement favorable est établi sur le domaine chimique et ne doit pas être généralisé à d’autres secteurs ou types de corpus. Les vecteurs de 1 024 dimensions imposent aussi de dimensionner le stockage de l’index et les calculs de similarité en fonction du volume documentaire. Enfin, son ancienneté d’environ trois ans est très importante dans ce domaine, ce qui rend probable un dépassement par des modèles plus récents et peut compliquer sa disponibilité dans les catalogues actuels. Usages pertinents : recherche, classification, clustering et sélection de passages RAG portant sur des textes du domaine chimique.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).