laion/larger_clap_music
Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/larger_clap_music est un modèle d’embedding de 194 millions de paramètres, tous actifs. Il produit des vecteurs denses de 512 dimensions et se concentre spécifiquement sur la musique.
Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/larger_clap_music est un modèle d’embedding de 194 millions de paramètres, tous actifs. Il produit des vecteurs denses de 512 dimensions et se concentre spécifiquement sur la musique.
CLAP associe un SWINTransformer, qui extrait les caractéristiques audio depuis un spectrogramme log-Mel, à RoBERTa pour le texte. Les embeddings audio et textuels sont projetés dans un espace latent commun. Cette représentation sert à la recherche sémantique audio-texte, au RAG multimodal, à la mesure de similarité, au clustering, à la classification audio zero-shot et à l’extraction de caractéristiques, sans générer de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | laion |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 22 mai 2023 |
| Dimension du vecteur | 512 |
| Représentation | dense, avec embeddings audio et textuels projetés dans un espace latent commun |
| Paramètres | 194 millions |
| Paramètres actifs | 194 millions |
| Modalités (entrée → sortie) | audio,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MAEB Audio-Only | 30,6 % | 57ᵉ / 60 | mteb | ✅ Mesuré |
| MTEB: MAEB | 20,7 % | 21ᵉ / 21 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MAEB Audio-Only
MTEB: MAEB
Notre analyse
Forces. L’intérêt de laion/larger_clap_music réside dans son espace commun pour la musique et le texte. Le produit scalaire entre les deux représentations fournit directement un score de similarité, utile pour retrouver un morceau à partir d’une description, rapprocher des contenus audio ou constituer des groupes thématiques. Les vecteurs de 512 dimensions limitent la taille des index par rapport à des représentations de dimension plus élevée. La licence MIT autorise par ailleurs l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d’attention. Les résultats MAEB le placent près du bas du classement en qualité d’embedding audio-only et au dernier rang sur l’évaluation combinant tâches audio et croisements audio-texte. Ces mesures ne montrent donc pas d’excellence sur les tracks disponibles, malgré une architecture conçue pour l’alignement multimodal. Sorti il y a environ trois ans, il appartient à une génération très ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents de sa catégorie. Usages pertinents : prototypage ouvert, indexation musicale, recherche audio-texte, similarité et clustering lorsque ses performances ont été validées sur le corpus cible.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).