bedrock/amazon-titan-embed-text-v1
Publié par Bedrock le 27 septembre 2023, bedrock/amazon-titan-embed-text-v1 est un modèle d’embedding dense. Il convertit les textes en vecteurs de 1 536 dimensions, destinés à représenter leur proximité sémantique.
Publié par Bedrock le 27 septembre 2023, bedrock/amazon-titan-embed-text-v1 est un modèle d’embedding dense. Il convertit les textes en vecteurs de 1 536 dimensions, destinés à représenter leur proximité sémantique.
Ces vecteurs peuvent alimenter un moteur de recherche sémantique, la récupération documentaire d’un système RAG, la mesure de similarité ou le clustering de contenus. Le modèle ne génère pas de texte, son rôle consiste à produire des représentations numériques indexables et comparables.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | bedrock |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 27 septembre 2023 |
| Dimension du vecteur | 1 536 |
| Représentation | dense |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Chemical | 73,1 % | 8ᵉ / 41 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Chemical
Notre analyse
Forces. L’évaluation MTEB disponible place le modèle dans le top 10 du domaine Chemical, sur un ensemble couvrant notamment le bitext mining, la classification et le clustering. Il constitue donc une option crédible pour organiser, rapprocher ou retrouver des textes relevant de la chimie. Ce résultat est rapporté par deux sources de données concordantes.
Limites et points d’attention. Avec 1 536 dimensions, chaque vecteur occupe davantage d’espace qu’une représentation de dimension plus réduite, ce qui peut alourdir l’index et rendre les recherches de similarité plus coûteuses à grande échelle. Sorti il y a environ trois ans, le modèle appartient à une génération très ancienne à l’échelle de l’IA, probablement dépassée par des embeddings plus récents et susceptible de ne plus figurer dans les catalogues actuels. Usages pertinents : recherche sémantique, RAG, similarité et clustering, notamment sur des corpus de chimie.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).