laion/clap-htsat-fused
Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/clap-htsat-fused est un modèle d’embedding de 154 millions de paramètres, tous actifs. Il produit des vecteurs de 512 dimensions représentant des contenus audio ou textuels dans un espace commun.
Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/clap-htsat-fused est un modèle d’embedding de 154 millions de paramètres, tous actifs. Il produit des vecteurs de 512 dimensions représentant des contenus audio ou textuels dans un espace commun.
Entraîné sur LAION-audio-630k, ce modèle CLAP associe les signaux audio à des descriptions en langage naturel par apprentissage contrastif. Son mécanisme de fusion de caractéristiques et son augmentation keyword-to-caption ciblent notamment les entrées audio de longueurs variables. Il sert à la recherche sémantique et au RAG multimodal, à la similarité audio-texte, au clustering, à l’extraction de caractéristiques et à la classification audio zero-shot.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | laion |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 22 mai 2023 |
| Dimension du vecteur | 512 |
| Représentation | embeddings audio et textuels |
| Paramètres | 154 millions |
| Paramètres actifs | 154 millions |
| Modalités (entrée → sortie) | audio,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MAEB Audio-Only | 43,5 % | 19ᵉ / 60 | mteb | ✅ Mesuré |
| MTEB: MAEB | 33,5 % | 13ᵉ / 21 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MAEB Audio-Only
MTEB: MAEB
Notre analyse
Forces. Les résultats MAEB situent surtout la qualité des embeddings audio seuls dans la partie supérieure du classement, ce qui soutient les usages de classification, de regroupement et de comparaison de contenus sonores. La représentation commune de l’audio et du texte permet également d’indexer des sons à partir de descriptions en langage naturel. Les vecteurs de 512 dimensions limitent la taille des index par rapport à des représentations plus larges, tandis que la licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration dans des applications commerciales.
Limites et points d’attention. Le classement MAEB global est moins favorable que celui du volet Audio-Only, avec une position dans la moitié inférieure sur l’ensemble combinant tâches audio seules et correspondances audio-texte. Les scénarios transmodaux apparaissent donc moins convaincants que l’extraction de caractéristiques purement audio. Sorti il y a près de trois ans, un âge très long à l’échelle de l’IA, le modèle appartient à une génération probablement dépassée par des solutions plus récentes et souvent retirée des catalogues d’éditeurs. Usages pertinents : recherche audio, classification zero-shot, clustering sonore et indexation audio-texte lorsque l’ouverture de la licence et des vecteurs compacts priment.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).