laion/clap-htsat-unfused

Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/clap-htsat-unfused est un modèle d’embedding de 153 millions de paramètres actifs. Il produit des vecteurs de 512 dimensions représentant des contenus audio et textuels dans un espace commun.

Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/clap-htsat-unfused est un modèle d’embedding de 153 millions de paramètres actifs. Il produit des vecteurs de 512 dimensions représentant des contenus audio et textuels dans un espace commun.

Son préentraînement contrastif langage-audio associe des sons à des descriptions en langage naturel grâce à des encodeurs dédiés. Le modèle sert notamment à la recherche sémantique audio-texte, à la sélection de contenus pour un système RAG multimodal, au calcul de similarité, au clustering et à la classification audio zero-shot. Il intègre une fusion de caractéristiques et une augmentation transformant des mots-clés en légendes afin de traiter des enregistrements de longueurs variables.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlaion
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie22 mai 2023
Dimension du vecteur512
Représentationreprésentations audio et textuelles
Paramètres153 millions
Paramètres actifs153 millions
Modalités (entrée → sortie)audio,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MAEB Audio-Only42,9 %20ᵉ / 60mteb✅ Mesuré
MTEB: MAEB33,0 %14ᵉ / 21mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MAEB Audio-Only

▶ laion/clap-htsat-unfused43 %
facebook/mms-1b-fl10241 %

MTEB: MAEB

▶ laion/clap-htsat-unfused33 %

Notre analyse

Forces. Les résultats MAEB placent le modèle plus favorablement sur les tâches exclusivement audio que sur l’évaluation combinant audio et correspondances audio-texte. Cette spécialisation le rend adapté à la classification, au clustering et à la comparaison d’enregistrements, tout en conservant une capacité de recherche intermodale fondée sur des descriptions textuelles. Les vecteurs de 512 dimensions offrent une représentation relativement compacte pour constituer un index. La licence MIT autorise par ailleurs l’auto-hébergement, l’adaptation et l’intégration dans des applications commerciales.

Limites et points d’attention. Le classement MAEB global se situe dans la partie basse des modèles évalués, ce qui signale une efficacité plus limitée lorsque les tâches audio-only sont associées à des correspondances entre audio et texte. Sorti en mai 2023, le modèle appartient à une génération ancienne à l’échelle de l’IA, probablement dépassée par des embeddings plus récents et susceptible de ne plus figurer dans les catalogues actuels. Ses 153 millions de paramètres impliquent également davantage de ressources qu’un encodeur plus léger. Usages pertinents : indexation audio, recherche par description, regroupement de sons et classification zero-shot dans un déploiement contrôlé sous licence MIT.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).