laion/larger_clap_music_and_speech

Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/larger_clap_music_and_speech est un modèle d’embedding multimodal de 194 millions de paramètres. Il produit des vecteurs denses de 512 dimensions alignant la musique, la parole et le texte dans un même espace latent.

Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/larger_clap_music_and_speech est un modèle d’embedding multimodal de 194 millions de paramètres. Il produit des vecteurs denses de 512 dimensions alignant la musique, la parole et le texte dans un même espace latent.

Le modèle sert à rechercher des contenus audio par requête textuelle, mesurer la similarité entre sons et descriptions, regrouper des enregistrements ou alimenter un système RAG multimodal. Son architecture associe un SWINTransformer appliqué aux spectrogrammes log-Mel et RoBERTa pour le texte, le produit scalaire entre vecteurs fournissant le score de similarité.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlaion
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie22 mai 2023
Dimension du vecteur512
Représentationdense multimodale audio-texte
Paramètres194 millions
Paramètres actifs194 millions
Modalités (entrée → sortie)audio,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MAEB Audio-Only45,4 %12ᵉ / 60mteb✅ Mesuré
MTEB: MAEB34,7 %10ᵉ / 21mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MAEB Audio-Only

▶ laion/larger_clap_music…45 %
MIT/ast-finetuned-audio…45 %

MTEB: MAEB

▶ laion/larger_clap_music…35 %

Notre analyse

Forces. Les résultats MAEB placent le modèle dans le groupe de tête sur les tâches audio seules, notamment la classification, le clustering et la comparaison de paires. Il atteint également le top 10 du classement combinant tâches audio et correspondances audio-texte. Entraîné par apprentissage contrastif sur des paires audio-texte, avec une spécialisation en musique et en parole, il prend en charge la classification audio zero-shot ainsi que l’extraction de caractéristiques audio et textuelles. Les vecteurs de 512 dimensions offrent une représentation relativement compacte pour constituer des index, tandis que la licence MIT autorise l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d'attention. Sur MAEB dans son ensemble, le classement reste intermédiaire malgré une place dans le top 10, ce qui indique un avantage moins net lorsque les évaluations incluent les tâches croisées audio-texte. Sorti il y a environ trois ans, le modèle appartient à une génération ancienne à l’échelle de l’IA, probablement dépassée par des solutions plus récentes et souvent retirée des catalogues actuels. Ses 194 millions de paramètres actifs impliquent aussi davantage de ressources qu’un encodeur plus petit. Usages pertinents : recherche sémantique audio-texte, classement zero-shot, similarité, clustering et RAG portant sur la musique ou la parole.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).