microsoft/msclap-2023

microsoft/msclap-2023 est un modèle d’embedding dense de Microsoft, publié le 1er septembre 2023 sous licence ouverte MIT. Il compte 160 millions de paramètres, tous actifs, et produit des vecteurs de 1 024 dimensions.

microsoft/msclap-2023 est un modèle d’embedding dense de Microsoft, publié le 1er septembre 2023 sous licence ouverte MIT. Il compte 160 millions de paramètres, tous actifs, et produit des vecteurs de 1 024 dimensions.

Le modèle représente notamment des contenus audio et leurs relations avec le texte, comme l’indiquent ses évaluations MAEB. Ces vecteurs servent à la recherche sémantique, au rapprochement audio-texte, à la récupération de contenus pour un système RAG, à la mesure de similarité et au clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMicrosoft
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie1 septembre 2023
Dimension du vecteur1 024
Représentationdense
Paramètres160 millions
Paramètres actifs160 millions
Modalités (entrée → sortie)audio,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MAEB Audio-Only44,2 %17ᵉ / 60mteb✅ Mesuré
MTEB: MAEB34,0 %12ᵉ / 21mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MAEB Audio-Only

▶ microsoft/msclap-202344 %
facebook/mms-1b-fl10241 %

MTEB: MAEB

▶ microsoft/msclap-202334 %

Notre analyse

Forces. Les résultats MAEB montrent une capacité exploitable sur les tâches audio seules, notamment la classification, le clustering et la comparaison de paires. Le modèle couvre aussi des tâches croisées entre audio et texte, ce qui permet d’associer une requête textuelle à des contenus audio sémantiquement proches. Sa licence MIT autorise l’auto-hébergement, l’adaptation et l’intégration dans des applications commerciales. Avec 160 millions de paramètres, il reste d’une taille mesurée pour un modèle d’embedding.

Limites et points d’attention. Son classement MAEB Audio-Only le place hors du groupe de tête, tandis que son résultat MAEB global se situe dans la seconde moitié des modèles évalués. Les tâches combinant audio seul et correspondance audio-texte apparaissent donc moins compétitives. Les vecteurs de 1 024 dimensions alourdissent aussi les index et le calcul de similarité par rapport à des représentations moins dimensionnelles. Sorti en 2023, il appartient à une génération désormais ancienne à l’échelle de l’IA et probablement dépassée par des modèles plus récents. Usages pertinents : recherche audio, rapprochement audio-texte, clustering et indexation sémantique auto-hébergée.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).