Qwen/Qwen2-Audio-7B
Publié par Qwen le 9 août 2024, Qwen/Qwen2-Audio-7B est un modèle d’embedding dense de 7 milliards de paramètres, tous actifs. Il transforme les contenus traités en vecteurs de 1 280 dimensions. Sa licence MIT autorise une réutilisation ouverte et permissive.
Publié par Qwen le 9 août 2024, Qwen/Qwen2-Audio-7B est un modèle d’embedding dense de 7 milliards de paramètres, tous actifs. Il transforme les contenus traités en vecteurs de 1 280 dimensions. Sa licence MIT autorise une réutilisation ouverte et permissive.
Issu d’un modèle audio-langage préentraîné acceptant divers signaux audio, il couvre l’analyse audio guidée par une instruction textuelle et l’interaction vocale sans entrée textuelle. Ses représentations servent à la recherche sémantique, au RAG multimodal, à la mesure de similarité et au clustering de contenus audio.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 9 août 2024 |
| Dimension du vecteur | 1 280 |
| Représentation | dense |
| Paramètres | 7 milliards |
| Paramètres actifs | 7 milliards |
| Longueur de séquence max | 131 072 tokens |
| Modalités (entrée → sortie) | audio,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MAEB Audio-Only | 51,0 % | 3ᵉ / 60 | mteb | ✅ Mesuré |
| MTEB: MAEB | 34,5 % | 11ᵉ / 21 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MAEB Audio-Only
MTEB: MAEB
Notre analyse
Forces. Qwen/Qwen2-Audio-7B se distingue surtout sur MAEB Audio-Only, où il figure parmi les dix meilleurs modèles et atteint la troisième place. Ce résultat indique une forte aptitude à représenter des contenus audio pour des tâches de classification, de clustering et de comparaison de paires. La représentation dense de 1 280 dimensions offre un niveau de détail adapté à la similarité sémantique. La licence MIT facilite la réutilisation, la modification et l’intégration dans des infrastructures maîtrisées.
Limites et points d'attention. Sur MAEB, qui associe tâches purement audio et correspondances entre audio et texte, le modèle se situe au milieu du classement. Son avantage est donc plus net pour les traitements audio seuls que pour les scénarios cross-modaux. Les vecteurs de 1 280 dimensions alourdissent les index et augmentent le coût de stockage et de recherche par rapport à des représentations plus compactes. Ses 7 milliards de paramètres actifs impliquent aussi un déploiement conséquent. Sorti en 2024, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents. Usages pertinents : recherche audio, regroupement de contenus sonores et détection de similarités.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).