Maya1
Maya1 est un modèle de synthèse vocale publié par Maya Research le 25 juin 2025. Il transforme du texte en parole et propose deux voix, avec un contrôle de leur style par des descriptions en langage naturel.
Maya1 est un modèle de synthèse vocale publié par Maya Research le 25 juin 2025. Il transforme du texte en parole et propose deux voix, avec un contrôle de leur style par des descriptions en langage naturel.
Dans Arena text-to-speech, Maya1 se situe en retrait du classement, derrière Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max et Luna TTS. Le premier est nettement devant en préférence humaine. Âgé d’environ un an, Maya1 est probablement dépassé par des modèles plus récents et appartient à une génération souvent retirée des catalogues.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Maya Research |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 25 juin 2025 |
| Voix disponibles | 2 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 26ᵉ | TTS-1 | 1139 |
| 27ᵉ | Speech 02 HD | 1130 |
| 28ᵉ | Maya1 | 1127 |
| 29ᵉ | Gemini 2.5 Flash Lite TTS | 1125 |
| 30ᵉ | Speech 2.8 Turbo | 1124 |
Notre analyse
Forces. Maya1 repose sur un transformeur autorégressif de type Llama, à décodeur seul, doté de 3 milliards de paramètres. Il produit des représentations audio SNAC, ensuite décodées à 24 kHz. La voix se configure par une description en langage naturel. Des balises insérées dans le texte pilotent le rire, le soupir, le chuchotement, la colère ou les pleurs. Le modèle couvre plusieurs accents, personnages et rôles en anglais. Il prend aussi en charge la synthèse en streaming et fonctionne sur un seul GPU.
Limites et points d’attention. Ses deux voix constituent un choix restreint pour des productions qui demandent une distribution vocale variée. La couverture se concentre sur l’anglais. Son positionnement en retrait dans Arena indique une préférence humaine moins favorable que celle des modèles en tête, avec un écart important face à Gemini 3.1 Flash TTS. Son ancienneté pèse également dans un secteur qui évolue rapidement. Usages pertinents : voix off en anglais, assistants vocaux, doublage expressif et outils d’accessibilité ; pour un résultat plus abouti, on lui préférera Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max ou Luna TTS.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).