facebook/SONAR
Publié par Meta le 21 mai 2021 sous licence ouverte MIT, facebook/SONAR est un modèle d'embedding multilingue et multimodal. Il représente les phrases textuelles ou vocales par un vecteur dense unique, de taille fixe et comportant 1 024 dimensions, dans un espace partagé entre texte et…
Publié par Meta le 21 mai 2021 sous licence ouverte MIT, facebook/SONAR est un modèle d'embedding multilingue et multimodal. Il représente les phrases textuelles ou vocales par un vecteur dense unique, de taille fixe et comportant 1 024 dimensions, dans un espace partagé entre texte et parole.
Ces représentations servent à mesurer la similarité, rechercher des contenus par leur sens, alimenter la récupération documentaire d'un système RAG ou regrouper des phrases par proximité. SONAR comprend aussi des composants de traduction entre texte et parole, avec certaines combinaisons de langues et de modalités traitées en zero-shot.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Meta |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 21 mai 2021 |
| Dimension du vecteur | 1 024 |
| Représentation | dense, à vecteur unique de taille fixe |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 13,5 % | 182ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Chinese | 33,4 % | 58ᵉ / 58 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Chinese
Notre analyse
Forces. Le principal intérêt de facebook/SONAR réside dans son espace de représentation commun au texte et à la parole, conçu pour des usages multilingues. Les encodeurs vocaux sont adaptés à chaque langue et entraînés par une approche enseignant-élève à partir de transcriptions. Un décodeur textuel commun prend en charge la traduction texte-à-texte et parole-à-texte. La licence MIT facilite l'intégration, la modification et les usages commerciaux. Le vecteur unique et fixe simplifie également l'indexation pour la similarité, le clustering et la recherche sémantique.
Limites et points d'attention. Les évaluations disponibles ne montrent pas d'excellence sur les tracks MTEB considérés. SONAR arrive dernier sur MTEB Chinese, qui couvre notamment la recherche, le reranking et la classification de paires, et se place près du bas du classement sur BEIR en recherche zero-shot. Ses 1 024 dimensions impliquent par ailleurs des index plus lourds et des calculs de similarité plus coûteux que des représentations de dimension inférieure. Sorti il y a près de cinq ans, il appartient à une génération ancienne à l'échelle de l'IA et paraît probablement dépassé par des modèles plus récents. Usages pertinents : expérimentations multilingues texte-parole, clustering et recherche sémantique lorsque l'espace multimodal partagé prime sur les performances MTEB récentes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).