Cohere/Cohere-embed-english-light-v3.0

Publié par Cohere le 2 novembre 2023, Cohere/Cohere-embed-english-light-v3.0 est un modèle d’embedding anglophone produisant des vecteurs denses de 384 dimensions. Il a été entraîné sur près d’un milliard de paires de textes en anglais.

Publié par Cohere le 2 novembre 2023, Cohere/Cohere-embed-english-light-v3.0 est un modèle d’embedding anglophone produisant des vecteurs denses de 384 dimensions. Il a été entraîné sur près d’un milliard de paires de textes en anglais.

Le modèle transforme requêtes et documents en représentations numériques destinées à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Il distingue les entrées « search_query » et « search_document », comparées par produit scalaire. Il est accessible via l’API Cohere, AWS SageMaker ou un déploiement privé.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurCohere
Poids🟢 Poids ouverts
Date de sortie2 novembre 2023
Dimension du vecteur384
Représentationdense
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval38,6 %84ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal33,2 %113ᵉ / 208mteb✅ Mesuré
MTEB: Medical41,4 %61ᵉ / 158mteb✅ Mesuré
MTEB: Legal40,4 %74ᵉ / 157mteb✅ Mesuré
MTEB: European49,0 %61ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French23,0 %118ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German20,3 %119ᵉ / 209mteb✅ Mesuré
MTEB: French50,6 %55ᵉ / 117mteb✅ Mesuré
MTEB: Indic35,0 %66ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Long-context Retrieval

▶ Cohere/Cohere-embed-eng…39 %

MTEB: French

omarelshehy/arabic-engl…52 %
▶ Cohere/Cohere-embed-eng…51 %

Notre analyse

Forces. Les résultats MTEB les plus favorables concernent les tracks French et European, où le modèle se situe autour du milieu du classement malgré un entraînement centré sur l’anglais. Le track Medical constitue également un domaine relativement solide, avec un placement dans la première moitié du classement. Les vecteurs de 384 dimensions forment un format compact, susceptible d’alléger les index et les calculs de similarité par rapport à des représentations plus grandes. La distinction entre requêtes et documents répond directement aux besoins des moteurs de recherche sémantique et des systèmes RAG.

Limites et points d'attention. Les performances sont plus faibles sur Legal et Long-context Retrieval, deux tracks où le modèle apparaît dans la moitié basse du classement. Le résultat Indic reste également modeste, ce qui limite son intérêt pour les langues concernées. Son orientation anglophone doit être prise en compte malgré des résultats européens intermédiaires. Sorti il y a environ trois ans, un âge très long à l’échelle de l’IA, il appartient à une génération probablement dépassée par des embeddings plus récents et souvent retirée des catalogues actuels. Usages pertinents : index anglophones compacts, recherche sémantique généraliste, RAG léger, similarité et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).