openai/text-embedding-3-large
Publié par OpenAI le 25 janvier 2024, openai/text-embedding-3-large est un modèle d’embedding dense produisant des vecteurs de 3 072 dimensions. Il convertit les textes en représentations numériques comparables, sans générer de contenu.
Publié par OpenAI le 25 janvier 2024, openai/text-embedding-3-large est un modèle d’embedding dense produisant des vecteurs de 3 072 dimensions. Il convertit les textes en représentations numériques comparables, sans générer de contenu.
Ces vecteurs servent à classer des résultats par proximité sémantique, alimenter la récupération documentaire d’un système RAG, mesurer la similarité ou regrouper des corpus par clustering. Âgé d’environ deux ans, le modèle appartient à une génération déjà ancienne à l’échelle de l’IA, probablement dépassée par des modèles plus récents et souvent retirée progressivement des catalogues.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | OpenAI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 25 janvier 2024 |
| Dimension du vecteur | 3 072 |
| Représentation | dense |
| Longueur de séquence max | 8 191 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 55,4 % | 37ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 52,4 % | 43ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 17,6 % | 10ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 52,6 % | 36ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 62,3 % | 30ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 67,8 % | 36ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 61,0 % | 19ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 59,4 % | 14ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 56,9 % | 19ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 56,3 % | 49ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 75,9 % | 4ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: Spanish | 68,5 % | 7ᵉ / 27 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les évaluations MTEB placent openai/text-embedding-3-large parmi les dix meilleurs modèles des tracks Chemical, Spanish et Scandinavian. Il se distingue donc pour la représentation de textes spécialisés en chimie ainsi que pour des traitements multilingues couvrant notamment l’espagnol, le danois, le suédois et le norvégien bokmål. Son classement sur Medical reste solide face à un ensemble comparatif étendu, ce qui soutient son emploi pour retrouver et rapprocher des contenus cliniques, biomédicaux ou destinés au grand public.
Limites et points d'attention. Les résultats sont moins dominants sur RTEB Finance et RTEB Healthcare, où le modèle se situe derrière plusieurs dizaines de concurrents. Son vecteur dense de 3 072 dimensions augmente aussi la taille des index, les besoins de stockage et le coût des recherches de similarité par rapport à des représentations plus compactes. Son ancienneté constitue enfin un point de vigilance dans un domaine où les générations se renouvellent rapidement. Usages pertinents : recherche sémantique, récupération documentaire pour RAG, détection de similarité et clustering, notamment sur des corpus chimiques, médicaux, hispanophones ou scandinaves.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).