microsoft/speecht5_multimodal

Publié par Microsoft le 16 mai 2022, microsoft/speecht5_multimodal est un modèle d’embedding multimodal de 298 millions de paramètres, tous actifs. Il produit des représentations denses de 768 dimensions et est distribué sous licence ouverte MIT.

Publié par Microsoft le 16 mai 2022, microsoft/speecht5_multimodal est un modèle d’embedding multimodal de 298 millions de paramètres, tous actifs. Il produit des représentations denses de 768 dimensions et est distribué sous licence ouverte MIT.

Ses vecteurs servent à mesurer la proximité entre contenus, à organiser des données par clustering et à alimenter des systèmes de recherche sémantique ou de RAG. Son évaluation MAEB porte notamment sur les embeddings audio et sur les correspondances entre audio et texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurMicrosoft
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie16 mai 2022
Dimension du vecteur768
Représentationdense
Paramètres298 millions
Paramètres actifs298 millions
Modalités (entrée → sortie)audio,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: MAEB Audio-Only37,7 %36ᵉ / 60mteb✅ Mesuré
MTEB: MAEB26,4 %19ᵉ / 21mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: MAEB Audio-Only

vitouphy/wav2vec2-xls-r…38 %
▶ microsoft/speecht5_mult…38 %
speechbrain/m-ctc-t-lar…36 %

MTEB: MAEB

lyrebird/wav2clip27 %
▶ microsoft/speecht5_mult…26 %

Notre analyse

Forces. Le modèle obtient sa meilleure tenue relative sur MAEB Audio-Only, consacré à la qualité des embeddings audio pour la classification, le clustering et la classification de paires. Il peut ainsi servir à rapprocher, classer ou regrouper des contenus audio selon leur similarité. Sa licence MIT facilite la réutilisation, la modification et le déploiement dans des applications, tandis que ses vecteurs denses de 768 dimensions fournissent un format directement exploitable par un index vectoriel.

Limites et points d’attention. Les résultats restent modestes sur MAEB Audio-Only, avec un classement dans la seconde moitié des modèles évalués. La faiblesse est plus nette sur MAEB, qui combine tâches audio seules et correspondances croisées entre audio et texte, où microsoft/speecht5_multimodal se place près du bas du classement. Sorti en 2022, il approche quatre ans, une ancienneté très longue à l’échelle de l’IA, et peut être dépassé par des modèles plus récents de sa catégorie. Usages pertinents : prototypes sous licence MIT, clustering audio, recherche par similarité et RAG multimodal lorsque ses performances mesurées restent suffisantes.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).