laion/larger_clap_music

Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/larger_clap_music est un modèle d’embedding de 194 millions de paramètres, tous actifs. Il produit des vecteurs denses de 512 dimensions et se concentre spécifiquement sur la musique.

Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/larger_clap_music est un modèle d’embedding de 194 millions de paramètres, tous actifs. Il produit des vecteurs denses de 512 dimensions et se concentre spécifiquement sur la musique.

CLAP associe un SWINTransformer, qui extrait les caractéristiques audio depuis un spectrogramme log-Mel, à RoBERTa pour le texte. Les embeddings audio et textuels sont projetés dans un espace latent commun. Cette représentation sert à la recherche sémantique audio-texte, au RAG multimodal, à la mesure de similarité, au clustering, à la classification audio zero-shot et à l’extraction de caractéristiques, sans générer de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlaion
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie22 mai 2023
Dimension du vecteur512
Représentationdense, avec embeddings audio et textuels projetés dans un espace latent commun
Paramètres194 millions
Paramètres actifs194 millions
Modalités (entrée → sortie)audio,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MAEB Audio-Only30,6 %57ᵉ / 60mteb✅ Mesuré
MTEB: MAEB20,7 %21ᵉ / 21mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MAEB Audio-Only

asapp/sew-d-tiny-100k-f…33 %
▶ laion/larger_clap_music31 %

MTEB: MAEB

lyrebird/wav2clip27 %
▶ laion/larger_clap_music21 %

Notre analyse

Forces. L’intérêt de laion/larger_clap_music réside dans son espace commun pour la musique et le texte. Le produit scalaire entre les deux représentations fournit directement un score de similarité, utile pour retrouver un morceau à partir d’une description, rapprocher des contenus audio ou constituer des groupes thématiques. Les vecteurs de 512 dimensions limitent la taille des index par rapport à des représentations de dimension plus élevée. La licence MIT autorise par ailleurs l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d’attention. Les résultats MAEB le placent près du bas du classement en qualité d’embedding audio-only et au dernier rang sur l’évaluation combinant tâches audio et croisements audio-texte. Ces mesures ne montrent donc pas d’excellence sur les tracks disponibles, malgré une architecture conçue pour l’alignement multimodal. Sorti il y a environ trois ans, il appartient à une génération très ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents de sa catégorie. Usages pertinents : prototypage ouvert, indexation musicale, recherche audio-texte, similarité et clustering lorsque ses performances ont été validées sur le corpus cible.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).