laion/clap-htsat-fused

Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/clap-htsat-fused est un modèle d’embedding de 154 millions de paramètres, tous actifs. Il produit des vecteurs de 512 dimensions représentant des contenus audio ou textuels dans un espace commun.

Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/clap-htsat-fused est un modèle d’embedding de 154 millions de paramètres, tous actifs. Il produit des vecteurs de 512 dimensions représentant des contenus audio ou textuels dans un espace commun.

Entraîné sur LAION-audio-630k, ce modèle CLAP associe les signaux audio à des descriptions en langage naturel par apprentissage contrastif. Son mécanisme de fusion de caractéristiques et son augmentation keyword-to-caption ciblent notamment les entrées audio de longueurs variables. Il sert à la recherche sémantique et au RAG multimodal, à la similarité audio-texte, au clustering, à l’extraction de caractéristiques et à la classification audio zero-shot.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlaion
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie22 mai 2023
Dimension du vecteur512
Représentationembeddings audio et textuels
Paramètres154 millions
Paramètres actifs154 millions
Modalités (entrée → sortie)audio,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MAEB Audio-Only43,5 %19ᵉ / 60mteb✅ Mesuré
MTEB: MAEB33,5 %13ᵉ / 21mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MAEB Audio-Only

▶ laion/clap-htsat-fused43 %
facebook/mms-1b-fl10241 %

MTEB: MAEB

▶ laion/clap-htsat-fused33 %

Notre analyse

Forces. Les résultats MAEB situent surtout la qualité des embeddings audio seuls dans la partie supérieure du classement, ce qui soutient les usages de classification, de regroupement et de comparaison de contenus sonores. La représentation commune de l’audio et du texte permet également d’indexer des sons à partir de descriptions en langage naturel. Les vecteurs de 512 dimensions limitent la taille des index par rapport à des représentations plus larges, tandis que la licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration dans des applications commerciales.

Limites et points d’attention. Le classement MAEB global est moins favorable que celui du volet Audio-Only, avec une position dans la moitié inférieure sur l’ensemble combinant tâches audio seules et correspondances audio-texte. Les scénarios transmodaux apparaissent donc moins convaincants que l’extraction de caractéristiques purement audio. Sorti il y a près de trois ans, un âge très long à l’échelle de l’IA, le modèle appartient à une génération probablement dépassée par des solutions plus récentes et souvent retirée des catalogues d’éditeurs. Usages pertinents : recherche audio, classification zero-shot, clustering sonore et indexation audio-texte lorsque l’ouverture de la licence et des vecteurs compacts priment.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).