google/text-embedding-004
Publié par Google le 14 mai 2024, google/text-embedding-004 est un modèle d’embedding dense produisant des vecteurs de 768 dimensions. Il convertit les textes en représentations numériques destinées à mesurer leur proximité sémantique, sans générer de contenu.
Publié par Google le 14 mai 2024, google/text-embedding-004 est un modèle d’embedding dense produisant des vecteurs de 768 dimensions. Il convertit les textes en représentations numériques destinées à mesurer leur proximité sémantique, sans générer de contenu.
Il peut servir à indexer des corpus pour la recherche sémantique, à retrouver des passages dans une architecture RAG, à comparer des documents ou à constituer des groupes thématiques par clustering. Son ancienneté, proche de deux ans, est importante à l’échelle de l’IA et le situe face aux modèles de sa période, souvent dépassés ou retirés des catalogues actuels.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 14 mai 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 55,5 % | 36ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 19,5 % | 6ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 46,6 % | 57ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 72,9 % | 26ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 48,6 % | 58ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 2,3 % | 24ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Reasoning Retrieval
Notre analyse
Forces. google/text-embedding-004 obtient son résultat le plus convaincant sur RTEB Finance, ce qui souligne son intérêt pour la recherche dans des corpus financiers, notamment les benchmarks et questions-réponses spécialisés. Il se classe aussi dans le top 10 de Reasoning Retrieval, signe d’une bonne aptitude à retrouver des informations pour des requêtes complexes. Son résultat sur BEIR indique une capacité correcte de recherche zero-shot à travers des tâches et domaines hétérogènes. Les vecteurs denses de 768 dimensions offrent par ailleurs un format d’index de taille maîtrisée pour la recherche de similarité et le clustering.
Limites et points d'attention. Les performances sont moins favorables sur RTEB German et RTEB Legal, où le modèle se situe dans une zone intermédiaire du classement malgré des évaluations couvrant notamment les domaines juridique, médical et professionnel en allemand. Instruction Following constitue sa faiblesse la plus nette, avec un score très bas et un classement éloigné des meilleurs modèles. Son âge le rend également moins représentatif de l’état actuel des embeddings. Usages pertinents : recherche sémantique généraliste ou financière, sélection de passages pour le RAG, similarité documentaire et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).