laion/larger_clap_general
Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/larger_clap_general est un modèle d’embedding dense de 194 millions de paramètres. Il produit des vecteurs de 512 dimensions et place l’audio et le texte dans un espace latent commun.
Publié par LAION le 22 mai 2023 sous licence ouverte MIT, laion/larger_clap_general est un modèle d’embedding dense de 194 millions de paramètres. Il produit des vecteurs de 512 dimensions et place l’audio et le texte dans un espace latent commun.
Entraîné par apprentissage contrastif sur des paires audio-texte, il couvre l’audio général, la musique et la parole. Il sert à la recherche sémantique intermodale, à l’extraction de caractéristiques, à la classification audio zero-shot, au clustering et à la récupération de contenus audio dans une architecture RAG. Il ne génère pas de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | laion |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 22 mai 2023 |
| Dimension du vecteur | 512 |
| Représentation | dense (embeddings audio et texte dans un espace latent commun) |
| Paramètres | 194 millions |
| Paramètres actifs | 194 millions |
| Modalités (entrée → sortie) | audio,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MAEB Audio-Only | 45,5 % | 11ᵉ / 60 | mteb | ✅ Mesuré |
| MTEB: MAEB | 35,0 % | 9ᵉ / 21 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MAEB Audio-Only
MTEB: MAEB
Notre analyse
Forces. Les résultats MAEB placent le modèle favorablement sur la qualité des embeddings audio seuls, avec des évaluations couvrant classification, clustering et comparaison de paires. Il figure aussi dans le top 10 du track MAEB combinant tâches audio seules et correspondances audio-texte. Son SWINTransformer extrait les caractéristiques depuis un spectrogramme log-Mel, tandis que RoBERTa traite le texte. Les deux représentations sont projetées dans un même espace, où leur produit scalaire mesure la similarité. Les vecteurs de 512 dimensions limitent la taille des index par rapport à des représentations plus larges, et la licence MIT facilite l’auto-hébergement ainsi que l’intégration dans des applications commerciales.
Limites et points d'attention. Son positionnement est moins distinctif sur l’ensemble mixte des tâches audio et audio-texte que sur l’évaluation audio seule. Avec 194 millions de paramètres actifs, son exécution reste plus exigeante qu’un encodeur nettement plus petit, même si les vecteurs produits demeurent relativement compacts. Sorti en 2023, il est très ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de sa catégorie, les modèles de cette période étant aussi souvent retirés des catalogues. Usages pertinents : recherche audio-texte, classification audio zero-shot, extraction de caractéristiques, similarité et clustering de contenus audio généraux, musicaux ou vocaux.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).