google/text-embedding-005

Publié par Google le 18 novembre 2024, google/text-embedding-005 est un modèle d’embedding dense qui convertit les textes en vecteurs de 768 dimensions. Son ancienneté, proche de deux ans, est importante à l’échelle de l’IA et le situe derrière des générations plus récentes.

Publié par Google le 18 novembre 2024, google/text-embedding-005 est un modèle d’embedding dense qui convertit les textes en vecteurs de 768 dimensions. Son ancienneté, proche de deux ans, est importante à l’échelle de l’IA et le situe derrière des générations plus récentes.

Il sert à indexer et comparer des contenus selon leur sens, notamment pour la recherche sémantique, la sélection de passages dans un système RAG, la mesure de similarité et le clustering de documents. Il ne produit pas de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurGoogle
Poids🟢 Poids ouverts
Date de sortie18 novembre 2024
Dimension du vecteur768
Représentationdense
Longueur de séquence max2 048 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR55,8 %32ᵉ / 192mteb✅ Mesuré
MTEB: Code Information Retrieval59,7 %33ᵉ / 49mteb✅ Mesuré
MTEB: Code61,5 %28ᵉ / 43mteb✅ Mesuré
MTEB: RTEB Legal44,8 %64ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare60,6 %35ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance71,9 %30ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French42,3 %64ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German45,2 %70ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les évaluations MTEB montrent un profil principalement orienté vers le retrieval. La recherche financière constitue son domaine le plus convaincant, avec un résultat situé dans le premier tiers du classement RTEB Finance. Sur BEIR, qui regroupe des tâches et domaines hétérogènes en zero-shot, le modèle se place également dans la partie supérieure du classement. Sa représentation dense de 768 dimensions fournit un format vectoriel standardisé pour l’indexation, la comparaison sémantique et le regroupement de corpus.

Limites et points d'attention. Les résultats sont moins solides dans la recherche médicale, où le classement RTEB Healthcare est plus intermédiaire. La recherche en allemand apparaît comme la faiblesse la plus nette, avec une position sensiblement plus basse sur RTEB German, couvrant notamment les domaines juridique, médical et commercial. Son âge le rend aussi probablement dépassé par des embeddings plus récents et l’inscrit dans une génération souvent retirée des catalogues des éditeurs. Usages pertinents : recherche sémantique généraliste, retrieval financier, RAG et clustering de documents.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).