Cohere/Cohere-embed-v4.0
Publié par Cohere le 1er décembre 2024, Cohere/Cohere-embed-v4.0 est un modèle d’embedding dense qui convertit les textes en vecteurs de 1 536 dimensions. Ses résultats couvrent notamment l’allemand et le français, ainsi que plusieurs domaines spécialisés.
Publié par Cohere le 1er décembre 2024, Cohere/Cohere-embed-v4.0 est un modèle d’embedding dense qui convertit les textes en vecteurs de 1 536 dimensions. Ses résultats couvrent notamment l’allemand et le français, ainsi que plusieurs domaines spécialisés.
Ces représentations numériques servent à retrouver des passages sémantiquement proches, à alimenter la phase de recherche d’un système RAG, à mesurer la similarité entre contenus ou à regrouper des documents par clustering. Le modèle ne produit pas de texte, son rôle consiste à structurer et comparer l’information.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Cohere |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 1 décembre 2024 |
| Dimension du vecteur | 1 536 |
| Représentation | dense |
| Longueur de séquence max | 128 000 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 50,4 % | 40ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 62,6 % | 27ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 75,0 % | 22ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 52,5 % | 35ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 71,8 % | 11ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB Finance
MTEB: RTEB German
Notre analyse
Forces. Les résultats RTEB indiquent une aptitude marquée pour le retrieval en allemand, où le modèle se classe dans le top 10 sur des corpus juridiques, médicaux et commerciaux. La recherche financière constitue également un point fort relatif, avec un classement dans la première partie du panel. Les évaluations en santé confirment une capacité exploitable sur des questions-réponses et des contenus médicaux. La représentation dense de 1 536 dimensions offre un espace vectoriel détaillé pour la recherche sémantique, le RAG, la similarité et le clustering.
Limites et points d’attention. Les performances sont moins bien classées en français et dans le domaine juridique, où le modèle reste derrière plusieurs dizaines de concurrents. Les vecteurs de 1 536 dimensions alourdissent aussi les index, la mémoire nécessaire et le coût de calcul des recherches par rapport à des représentations plus petites. Avec environ deux ans d’ancienneté, une durée très longue à l’échelle de l’IA, ce modèle appartient à une génération probablement dépassée par des solutions plus récentes et souvent retirée des catalogues éditeurs. Usages pertinents : retrieval en allemand, recherche financière ou médicale, RAG documentaire et regroupement sémantique de corpus.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).