google/text-embedding-005
Publié par Google le 18 novembre 2024, google/text-embedding-005 est un modèle d’embedding dense qui convertit les textes en vecteurs de 768 dimensions. Son ancienneté, proche de deux ans, est importante à l’échelle de l’IA et le situe derrière des générations plus récentes.
Publié par Google le 18 novembre 2024, google/text-embedding-005 est un modèle d’embedding dense qui convertit les textes en vecteurs de 768 dimensions. Son ancienneté, proche de deux ans, est importante à l’échelle de l’IA et le situe derrière des générations plus récentes.
Il sert à indexer et comparer des contenus selon leur sens, notamment pour la recherche sémantique, la sélection de passages dans un système RAG, la mesure de similarité et le clustering de documents. Il ne produit pas de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 18 novembre 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 55,8 % | 32ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 59,7 % | 33ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 61,5 % | 28ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 44,8 % | 64ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 60,6 % | 35ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 71,9 % | 30ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 42,3 % | 64ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 45,2 % | 70ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Code Information Retrieval
Notre analyse
Forces. Les évaluations MTEB montrent un profil principalement orienté vers le retrieval. La recherche financière constitue son domaine le plus convaincant, avec un résultat situé dans le premier tiers du classement RTEB Finance. Sur BEIR, qui regroupe des tâches et domaines hétérogènes en zero-shot, le modèle se place également dans la partie supérieure du classement. Sa représentation dense de 768 dimensions fournit un format vectoriel standardisé pour l’indexation, la comparaison sémantique et le regroupement de corpus.
Limites et points d'attention. Les résultats sont moins solides dans la recherche médicale, où le classement RTEB Healthcare est plus intermédiaire. La recherche en allemand apparaît comme la faiblesse la plus nette, avec une position sensiblement plus basse sur RTEB German, couvrant notamment les domaines juridique, médical et commercial. Son âge le rend aussi probablement dépassé par des embeddings plus récents et l’inscrit dans une génération souvent retirée des catalogues des éditeurs. Usages pertinents : recherche sémantique généraliste, retrieval financier, RAG et clustering de documents.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).