openai/text-embedding-ada-002

Publié par OpenAI le 15 décembre 2022, openai/text-embedding-ada-002 est un modèle d’embedding qui transforme le texte en représentations vectorielles denses de 1 536 dimensions. Avec environ quatre ans d’ancienneté, il appartient à une génération désormais ancienne à l’échelle de l’IA…

Publié par OpenAI le 15 décembre 2022, openai/text-embedding-ada-002 est un modèle d’embedding qui transforme le texte en représentations vectorielles denses de 1 536 dimensions. Avec environ quatre ans d’ancienneté, il appartient à une génération désormais ancienne à l’échelle de l’IA et probablement dépassée par des modèles plus récents.

Ses vecteurs servent à comparer la proximité sémantique de textes, alimenter la recherche documentaire et la récupération de passages dans un système RAG, ou regrouper des contenus par similarité. Le modèle ne produit pas de texte, mais fournit une représentation numérique destinée à l’indexation et au calcul de distances.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurOpenAI
Poids🟢 Poids ouverts
Date de sortie15 décembre 2022
Dimension du vecteur1 536
Représentationdense
Longueur de séquence max8 191 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR49,2 %107ᵉ / 192mteb✅ Mesuré
MTEB: Chemical72,5 %11ᵉ / 41mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le meilleur résultat communiqué concerne le track Chemical de MTEB, où openai/text-embedding-ada-002 se place dans le groupe de tête. Cette évaluation couvre notamment le bitext mining, la classification et le clustering appliqués aux textes du domaine chimique, ce qui indique une aptitude notable à représenter ce vocabulaire spécialisé. Sa sortie dense de 1 536 dimensions fournit une représentation unique et directement exploitable dans un index vectoriel pour la similarité, le regroupement et la récupération de passages.

Limites et points d'attention. Sur BEIR, qui mesure la recherche zero-shot dans des tâches et domaines hétérogènes, le modèle se situe dans la moitié inférieure du classement. Sa généralisation en retrieval apparaît donc moins compétitive que sa performance sur les textes chimiques. Les 1 536 valeurs stockées pour chaque document influent directement sur la taille de l’index et sur le volume de calcul nécessaire aux comparaisons. Son ancienneté, très élevée à l’échelle de l’IA, suggère aussi un modèle probablement dépassé et susceptible d’avoir été retiré des catalogues actuels. Usages pertinents : recherche sémantique, RAG, similarité et clustering, notamment sur des corpus chimiques après validation sur les données ciblées.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).