Cohere/Cohere-embed-english-v3.0
Publié par Cohere le 2 novembre 2023, Cohere/Cohere-embed-english-v3.0 est un modèle d’embedding anglophone dense, entraîné sur près d’un milliard de paires en anglais. Il convertit chaque texte en un vecteur de 1 024 dimensions.
Publié par Cohere le 2 novembre 2023, Cohere/Cohere-embed-english-v3.0 est un modèle d’embedding anglophone dense, entraîné sur près d’un milliard de paires en anglais. Il convertit chaque texte en un vecteur de 1 024 dimensions.
Le modèle sert à indexer des documents pour la recherche sémantique, alimenter la récupération d’un système RAG, mesurer la similarité ou réaliser du clustering. Il distingue les documents, avec « search_document », des requêtes, avec « search_query ». Son exploitation passe par l’API Cohere, AWS SageMaker ou un déploiement privé.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Cohere |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 2 novembre 2023 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 42,1 % | 60ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 16,3 % | 13ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 36,6 % | 90ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 48,0 % | 54ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 51,4 % | 67ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 45,3 % | 51ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 43,1 % | 58ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 52,2 % | 45ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 34,6 % | 81ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 25,8 % | 106ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 54,5 % | 38ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Indic | 37,2 % | 53ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Reasoning Retrieval
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent les évaluations French et European, où le modèle se situe dans la partie supérieure du classement malgré un entraînement annoncé en anglais. RTEB Finance constitue son meilleur résultat parmi les domaines spécialisés évalués, devant la santé, le médical et le juridique. La séparation explicite entre documents et requêtes adapte les vecteurs aux deux rôles d’un moteur de recherche sémantique. Les options d’exploitation couvrent un service hébergé, une intégration AWS SageMaker et un déploiement privé.
Limites et points d’attention. Les performances reculent sur les corpus spécialisés, particulièrement en recherche juridique et médicale, où le modèle reste en milieu de tableau. Le vecteur dense de 1 024 dimensions implique un index plus volumineux et davantage de calcul qu’une représentation de dimension inférieure. Sorti il y a environ trois ans, il est très ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents et susceptible d’avoir été retiré de certains catalogues. Usages pertinents : recherche sémantique principalement anglophone, récupération pour RAG, similarité documentaire et clustering, avec validation spécifique indispensable en finance, santé, médecine et droit.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).