microsoft/msclap-2022
Publié par Microsoft le 1er décembre 2022, microsoft/msclap-2022 est un modèle d’embedding dense de 196 millions de paramètres actifs. Il produit des vecteurs de 1 024 dimensions et se distingue par son orientation audio, évaluée sur des tâches audio seules et sur des associations entre…
Publié par Microsoft le 1er décembre 2022, microsoft/msclap-2022 est un modèle d’embedding dense de 196 millions de paramètres actifs. Il produit des vecteurs de 1 024 dimensions et se distingue par son orientation audio, évaluée sur des tâches audio seules et sur des associations entre audio et texte.
Ses représentations numériques peuvent alimenter la recherche sémantique, la mesure de similarité, le clustering et les mécanismes de récupération d’un système RAG. Distribué sous licence ouverte MIT, le modèle peut être auto-hébergé, adapté et intégré à des applications commerciales.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Microsoft |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 1 décembre 2022 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 196 millions |
| Paramètres actifs | 196 millions |
| Modalités (entrée → sortie) | audio,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MAEB Audio-Only | 40,1 % | 28ᵉ / 60 | mteb | ✅ Mesuré |
| MTEB: MAEB | 32,2 % | 16ᵉ / 21 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MAEB Audio-Only
MTEB: MAEB
Notre analyse
Forces. microsoft/msclap-2022 obtient ses résultats relatifs les plus favorables sur MAEB Audio-Only, qui couvre notamment la classification, le clustering et la classification de paires. Son positionnement y reste intermédiaire, mais il est meilleur que sur l’évaluation MAEB globale. La représentation dense de 1 024 dimensions offre un espace vectoriel détaillé pour comparer et regrouper des contenus. La licence MIT constitue son principal atout pratique, avec des possibilités larges d’auto-hébergement, de modification et d’exploitation commerciale.
Limites et points d'attention. Sur MAEB, qui combine tâches audio seules et tâches croisées audio-texte, le modèle se place dans la partie basse du classement. Son aptitude aux usages multimodaux apparaît donc moins compétitive que son comportement sur les seules tâches audio. Les vecteurs de 1 024 dimensions alourdissent également les index et rendent la recherche plus coûteuse que des représentations plus compactes. Avec près de quatre ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle de 2022 est probablement dépassé par des solutions plus récentes et peut avoir été retiré du catalogue de l’éditeur. Usages pertinents : classification, similarité, clustering et recherche sémantique centrés sur l’audio, notamment lorsqu’une licence MIT est prioritaire.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).