bedrock/amazon-titan-embed-text-v1

Publié par Bedrock le 27 septembre 2023, bedrock/amazon-titan-embed-text-v1 est un modèle d’embedding dense. Il convertit les textes en vecteurs de 1 536 dimensions, destinés à représenter leur proximité sémantique.

Publié par Bedrock le 27 septembre 2023, bedrock/amazon-titan-embed-text-v1 est un modèle d’embedding dense. Il convertit les textes en vecteurs de 1 536 dimensions, destinés à représenter leur proximité sémantique.

Ces vecteurs peuvent alimenter un moteur de recherche sémantique, la récupération documentaire d’un système RAG, la mesure de similarité ou le clustering de contenus. Le modèle ne génère pas de texte, son rôle consiste à produire des représentations numériques indexables et comparables.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurbedrock
Poids🟢 Poids ouverts
Date de sortie27 septembre 2023
Dimension du vecteur1 536
Représentationdense
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Chemical73,1 %8ᵉ / 41mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. L’évaluation MTEB disponible place le modèle dans le top 10 du domaine Chemical, sur un ensemble couvrant notamment le bitext mining, la classification et le clustering. Il constitue donc une option crédible pour organiser, rapprocher ou retrouver des textes relevant de la chimie. Ce résultat est rapporté par deux sources de données concordantes.

Limites et points d’attention. Avec 1 536 dimensions, chaque vecteur occupe davantage d’espace qu’une représentation de dimension plus réduite, ce qui peut alourdir l’index et rendre les recherches de similarité plus coûteuses à grande échelle. Sorti il y a environ trois ans, le modèle appartient à une génération très ancienne à l’échelle de l’IA, probablement dépassée par des embeddings plus récents et susceptible de ne plus figurer dans les catalogues actuels. Usages pertinents : recherche sémantique, RAG, similarité et clustering, notamment sur des corpus de chimie.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).