openai/text-embedding-3-large

Publié par OpenAI le 25 janvier 2024, openai/text-embedding-3-large est un modèle d’embedding dense produisant des vecteurs de 3 072 dimensions. Il convertit les textes en représentations numériques comparables, sans générer de contenu.

Publié par OpenAI le 25 janvier 2024, openai/text-embedding-3-large est un modèle d’embedding dense produisant des vecteurs de 3 072 dimensions. Il convertit les textes en représentations numériques comparables, sans générer de contenu.

Ces vecteurs servent à classer des résultats par proximité sémantique, alimenter la récupération documentaire d’un système RAG, mesurer la similarité ou regrouper des corpus par clustering. Âgé d’environ deux ans, le modèle appartient à une génération déjà ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et souvent retirée progressivement des catalogues.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurOpenAI
Poids🟢 Poids ouverts
Date de sortie25 janvier 2024
Dimension du vecteur3 072
Représentationdense
Longueur de séquence max8 191 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR55,4 %37ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval52,4 %43ᵉ / 170mteb✅ Mesuré
MTEB: Reasoning Retrieval17,6 %10ᵉ / 29mteb✅ Mesuré
MTEB: RTEB Legal52,6 %36ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare62,3 %30ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance67,8 %36ᵉ / 97mteb✅ Mesuré
MTEB: Medical61,0 %19ᵉ / 158mteb✅ Mesuré
MTEB: Legal59,4 %14ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French56,9 %19ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German56,3 %49ᵉ / 209mteb✅ Mesuré
MTEB: Chemical75,9 %4ᵉ / 41mteb✅ Mesuré
MTEB: Spanish68,5 %7ᵉ / 27mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les évaluations MTEB placent openai/text-embedding-3-large parmi les dix meilleurs modèles des tracks Chemical, Spanish et Scandinavian. Il se distingue donc pour la représentation de textes spécialisés en chimie ainsi que pour des traitements multilingues couvrant notamment l’espagnol, le danois, le suédois et le norvégien bokmål. Son classement sur Medical reste solide face à un ensemble comparatif étendu, ce qui soutient son emploi pour retrouver et rapprocher des contenus cliniques, biomédicaux ou destinés au grand public.

Limites et points d'attention. Les résultats sont moins dominants sur RTEB Finance et RTEB Healthcare, où le modèle se situe derrière plusieurs dizaines de concurrents. Son vecteur dense de 3 072 dimensions augmente aussi la taille des index, les besoins de stockage et le coût des recherches de similarité par rapport à des représentations plus compactes. Son ancienneté constitue enfin un point de vigilance dans un domaine où les générations se renouvellent rapidement. Usages pertinents : recherche sémantique, récupération documentaire pour RAG, détection de similarité et clustering, notamment sur des corpus chimiques, médicaux, hispanophones ou scandinaves.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).