openai/text-embedding-3-small
Publié par OpenAI le 25 janvier 2024, openai/text-embedding-3-small est un modèle d’embedding dense qui convertit les textes en vecteurs de 1 536 dimensions. Il appartient à une génération désormais ancienne à l’échelle de l’IA, avec près de deux ans d’ancienneté, et peut être dépassé…
Publié par OpenAI le 25 janvier 2024, openai/text-embedding-3-small est un modèle d’embedding dense qui convertit les textes en vecteurs de 1 536 dimensions. Il appartient à une génération désormais ancienne à l’échelle de l’IA, avec près de deux ans d’ancienneté, et peut être dépassé par des modèles plus récents.
Ses vecteurs servent à indexer et comparer des contenus selon leur proximité sémantique. Le modèle peut ainsi soutenir la recherche sémantique, la récupération de passages dans un système RAG, le classement de résultats, la mesure de similarité et le clustering de documents.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | OpenAI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 25 janvier 2024 |
| Dimension du vecteur | 1 536 |
| Représentation | dense |
| Longueur de séquence max | 8 191 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 51,1 % | 90ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 53,6 % | 42ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 46,8 % | 53ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 52,3 % | 50ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 60,8 % | 45ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 55,6 % | 35ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 56,3 % | 22ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 44,2 % | 62ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 54,8 % | 51ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 73,2 % | 7ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: Spanish | 65,8 % | 14ᵉ / 27 | mteb | ✅ Mesuré |
| MTEB: Scandinavian | 58,4 % | 22ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur résultat relatif apparaît sur MTEB Chemical, où le modèle figure dans le top 10 pour des tâches comprenant notamment le bitext mining, la classification et le clustering. Il obtient aussi des rangs solides sur MTEB Legal et MTEB Medical, ce qui indique une aptitude utile à la recherche dans des documents juridiques, cliniques, biomédicaux ou de santé grand public. Les évaluations MTEB Spanish et MTEB Scandinavian montrent également une capacité mesurée sur l’espagnol ainsi que sur le danois, le suédois et le norvégien bokmål.
Limites et points d'attention. Les résultats sont moins distinctifs sur RTEB Finance, où le modèle se situe dans la seconde moitié du classement, notamment pour la récupération d’informations financières et les questions-réponses du domaine. Les tracks Spanish et Scandinavian le placent également autour du milieu de tableau plutôt que parmi les références. Chaque texte étant représenté par 1 536 valeurs, la taille des index et le travail de comparaison augmentent avec le nombre de documents. Son ancienneté, très longue à l’échelle de l’IA, le rend probablement dépassé face à des embeddings plus récents. Usages pertinents : recherche sémantique, RAG, similarité et clustering, particulièrement sur des corpus chimiques, juridiques ou médicaux.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).