openai/whisper-medium
Publié par OpenAI le 27 septembre 2022, openai/whisper-medium est un modèle d’embedding dense de 769 millions de paramètres, tous actifs. Il produit des vecteurs de 1 024 dimensions. Distribué sous licence ouverte MIT, il peut être auto-hébergé et intégré à des systèmes indépendants.
Publié par OpenAI le 27 septembre 2022, openai/whisper-medium est un modèle d’embedding dense de 769 millions de paramètres, tous actifs. Il produit des vecteurs de 1 024 dimensions. Distribué sous licence ouverte MIT, il peut être auto-hébergé et intégré à des systèmes indépendants.
Son architecture Transformer encodeur-décodeur a été pré-entraînée sur des tâches multilingues de reconnaissance et de traduction de la parole. Ses représentations peuvent servir à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, notamment à partir de contenus audio transformés en spectrogrammes log-Mel.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | OpenAI |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 27 septembre 2022 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 769 millions |
| Paramètres actifs | 769 millions |
| Modalités (entrée → sortie) | audio → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: MAEB Audio-Only | 48,4 % | 8ᵉ / 60 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: MAEB Audio-Only
Notre analyse
Forces. openai/whisper-medium se distingue surtout sur MAEB Audio-Only, où il figure dans le top 10. Ce résultat indique une bonne qualité globale des embeddings audio pour des tâches de classification, de clustering et de comparaison par paires. Son traitement multilingue couvre la reconnaissance de parole et la traduction, avec gestion de la langue, de la tâche et des timestamps par des tokens de contexte. La licence MIT constitue un atout pratique pour l’auto-hébergement, la modification et l’intégration dans des chaînes de recherche ou de RAG.
Limites et points d'attention. Avec 769 millions de paramètres actifs, le modèle reste relativement lourd pour un composant d’indexation. Ses vecteurs de 1 024 dimensions augmentent également la taille des index et le coût des recherches de similarité par rapport à des représentations plus compactes. Sorti en 2022, il est très ancien à l’échelle de l’IA, probablement dépassé par des modèles plus récents et souvent retiré des catalogues actuels. Les usages pertinents concernent surtout l’indexation, la similarité, la classification et le regroupement de contenus audio multilingues.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).