bedrock/cohere-embed-english-v3
bedrock/cohere-embed-english-v3 est un modèle d’embedding dense publié par bedrock le 2 novembre 2023. Il transforme les textes en vecteurs de 1 024 dimensions, destinés à représenter leur proximité sémantique plutôt qu’à produire du contenu.
bedrock/cohere-embed-english-v3 est un modèle d’embedding dense publié par bedrock le 2 novembre 2023. Il transforme les textes en vecteurs de 1 024 dimensions, destinés à représenter leur proximité sémantique plutôt qu’à produire du contenu.
Ces représentations peuvent alimenter un moteur de recherche sémantique, la sélection de passages pour un système RAG, le calcul de similarité ou le regroupement de documents par clustering. Avec environ trois ans d’ancienneté, le modèle appartient désormais à une génération ancienne à l’échelle de l’IA, probablement dépassée par des solutions plus récentes et susceptible d’avoir été retirée des catalogues actuels.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | bedrock |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 2 novembre 2023 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Chemical | 72,9 % | 9ᵉ / 41 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Chemical
Notre analyse
Forces. bedrock/cohere-embed-english-v3 se classe dans le top 10 du benchmark MTEB consacré au domaine chimique. Ce résultat indique une bonne qualité de représentation des textes spécialisés de ce secteur, sur un ensemble couvrant notamment le bitext mining, la classification et le clustering. Le format dense de 1 024 dimensions fournit une représentation vectorielle directement exploitable dans des index de recherche sémantique et des pipelines de rapprochement documentaire.
Limites et points d’attention. Son positionnement favorable est établi sur le domaine chimique et ne doit pas être généralisé à d’autres secteurs ou types de corpus. Les vecteurs de 1 024 dimensions imposent aussi de dimensionner le stockage de l’index et les calculs de similarité en fonction du volume documentaire. Enfin, son ancienneté d’environ trois ans est très importante dans ce domaine, ce qui rend probable un dépassement par des modèles plus récents et peut compliquer sa disponibilité dans les catalogues actuels. Usages pertinents : recherche, classification, clustering et sélection de passages RAG portant sur des textes du domaine chimique.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).