google/text-embedding-004

Publié par Google le 14 mai 2024, google/text-embedding-004 est un modèle d’embedding dense produisant des vecteurs de 768 dimensions. Il convertit les textes en représentations numériques destinées à mesurer leur proximité sémantique, sans générer de contenu.

Publié par Google le 14 mai 2024, google/text-embedding-004 est un modèle d’embedding dense produisant des vecteurs de 768 dimensions. Il convertit les textes en représentations numériques destinées à mesurer leur proximité sémantique, sans générer de contenu.

Il peut servir à indexer des corpus pour la recherche sémantique, à retrouver des passages dans une architecture RAG, à comparer des documents ou à constituer des groupes thématiques par clustering. Son ancienneté, proche de deux ans, est importante à l’échelle de l’IA et le situe face aux modèles de sa période, souvent dépassés ou retirés des catalogues actuels.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurGoogle
Poids🟢 Poids ouverts
Date de sortie14 mai 2024
Dimension du vecteur768
Représentationdense
Longueur de séquence max2 048 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR55,5 %36ᵉ / 192mteb✅ Mesuré
MTEB: Reasoning Retrieval19,5 %6ᵉ / 29mteb✅ Mesuré
MTEB: RTEB Legal46,6 %57ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Finance72,9 %26ᵉ / 97mteb✅ Mesuré
MTEB: RTEB German48,6 %58ᵉ / 209mteb✅ Mesuré
MTEB: Instruction Following2,3 %24ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. google/text-embedding-004 obtient son résultat le plus convaincant sur RTEB Finance, ce qui souligne son intérêt pour la recherche dans des corpus financiers, notamment les benchmarks et questions-réponses spécialisés. Il se classe aussi dans le top 10 de Reasoning Retrieval, signe d’une bonne aptitude à retrouver des informations pour des requêtes complexes. Son résultat sur BEIR indique une capacité correcte de recherche zero-shot à travers des tâches et domaines hétérogènes. Les vecteurs denses de 768 dimensions offrent par ailleurs un format d’index de taille maîtrisée pour la recherche de similarité et le clustering.

Limites et points d'attention. Les performances sont moins favorables sur RTEB German et RTEB Legal, où le modèle se situe dans une zone intermédiaire du classement malgré des évaluations couvrant notamment les domaines juridique, médical et professionnel en allemand. Instruction Following constitue sa faiblesse la plus nette, avec un score très bas et un classement éloigné des meilleurs modèles. Son âge le rend également moins représentatif de l’état actuel des embeddings. Usages pertinents : recherche sémantique généraliste ou financière, sélection de passages pour le RAG, similarité documentaire et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).