laion/larger_clap_general

Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/larger_clap_general est un modèle d’embedding dense de 194 millions de paramètres. Il produit des vecteurs de 512 dimensions et place l’audio et le texte dans un espace latent commun.

Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/larger_clap_general est un modèle d’embedding dense de 194 millions de paramètres. Il produit des vecteurs de 512 dimensions et place l’audio et le texte dans un espace latent commun.

Entraîné par apprentissage contrastif sur des paires audio-texte, il couvre l’audio général, la musique et la parole. Il sert à la recherche sémantique intermodale, à l’extraction de caractéristiques, à la classification audio zero-shot, au clustering et à la récupération de contenus audio dans une architecture RAG. Il ne génère pas de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlaion
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie22 mai 2023
Dimension du vecteur512
Représentationdense (embeddings audio et texte dans un espace latent commun)
Paramètres194 millions
Paramètres actifs194 millions
Modalités (entrée → sortie)audio,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MAEB Audio-Only45,5 %11ᵉ / 60mteb✅ Mesuré
MTEB: MAEB35,0 %9ᵉ / 21mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MAEB Audio-Only

▶ laion/larger_clap_gener…46 %
MIT/ast-finetuned-audio…45 %

MTEB: MAEB

▶ laion/larger_clap_gener…35 %

Notre analyse

Forces. Les résultats MAEB placent le modèle favorablement sur la qualité des embeddings audio seuls, avec des évaluations couvrant classification, clustering et comparaison de paires. Il figure aussi dans le top 10 du track MAEB combinant tâches audio seules et correspondances audio-texte. Son SWINTransformer extrait les caractéristiques depuis un spectrogramme log-Mel, tandis que RoBERTa traite le texte. Les deux représentations sont projetées dans un même espace, où leur produit scalaire mesure la similarité. Les vecteurs de 512 dimensions limitent la taille des index par rapport à des représentations plus larges, et la licence MIT facilite l’auto-hébergement ainsi que l’intégration dans des applications commerciales.

Limites et points d'attention. Son positionnement est moins distinctif sur l’ensemble mixte des tâches audio et audio-texte que sur l’évaluation audio seule. Avec 194 millions de paramètres actifs, son exécution reste plus exigeante qu’un encodeur nettement plus petit, même si les vecteurs produits demeurent relativement compacts. Sorti en 2023, il est très ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de sa catégorie, les modèles de cette période étant aussi souvent retirés des catalogues. Usages pertinents : recherche audio-texte, classification audio zero-shot, extraction de caractéristiques, similarité et clustering de contenus audio généraux, musicaux ou vocaux.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).