Maya1

Maya1 est un modèle de synthèse vocale publié par Maya Research le 25 juin 2025. Il transforme du texte en parole et propose deux voix, avec un contrôle de leur style par des descriptions en langage naturel.

Maya1 est un modèle de synthèse vocale publié par Maya Research le 25 juin 2025. Il transforme du texte en parole et propose deux voix, avec un contrôle de leur style par des descriptions en langage naturel.

Dans Arena text-to-speech, Maya1 se situe en retrait du classement, derrière Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max et Luna TTS. Le premier est nettement devant en préférence humaine. Âgé d’environ un an, Maya1 est probablement dépassé par des modèles plus récents et appartient à une génération souvent retirée des catalogues.

Caractéristiques

CaractéristiqueValeur
TypeSynthèse vocale (text-to-speech)
ÉditeurMaya Research
Poids🟢 Poids ouverts
Date de sortie25 juin 2025
Voix disponibles2

Classements Arena (Elo)

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
26ᵉTTS-11139
27ᵉSpeech 02 HD1130
28ᵉMaya11127
29ᵉGemini 2.5 Flash Lite TTS1125
30ᵉSpeech 2.8 Turbo1124

Notre analyse

Forces. Maya1 repose sur un transformeur autorégressif de type Llama, à décodeur seul, doté de 3 milliards de paramètres. Il produit des représentations audio SNAC, ensuite décodées à 24 kHz. La voix se configure par une description en langage naturel. Des balises insérées dans le texte pilotent le rire, le soupir, le chuchotement, la colère ou les pleurs. Le modèle couvre plusieurs accents, personnages et rôles en anglais. Il prend aussi en charge la synthèse en streaming et fonctionne sur un seul GPU.

Limites et points d’attention. Ses deux voix constituent un choix restreint pour des productions qui demandent une distribution vocale variée. La couverture se concentre sur l’anglais. Son positionnement en retrait dans Arena indique une préférence humaine moins favorable que celle des modèles en tête, avec un écart important face à Gemini 3.1 Flash TTS. Son ancienneté pèse également dans un secteur qui évolue rapidement. Usages pertinents : voix off en anglais, assistants vocaux, doublage expressif et outils d’accessibilité ; pour un résultat plus abouti, on lui préférera Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max ou Luna TTS.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).