Qwen-Audio-3.0-TTS-Plus
Qwen-Audio-3.0-TTS-Plus est un modèle de synthèse vocale édité par Qwen et sorti le 1er juillet 2026. Il transforme du texte en parole et propose quatre voix, un choix adapté à la création de plusieurs identités vocales au sein d’un même projet.
Qwen-Audio-3.0-TTS-Plus est un modèle de synthèse vocale édité par Qwen et sorti le 1er juillet 2026. Il transforme du texte en parole et propose quatre voix, un choix adapté à la création de plusieurs identités vocales au sein d’un même projet.
Dans l’Arena text-to-speech, il se place derrière Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max et Luna TTS. L’écart avec Gemini 3.1 Flash TTS reste faible, les deux modèles sont proches en préférence humaine.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Qwen |
| Poids | ▫ n.d. |
| Date de sortie | 1 juillet 2026 |
| Voix disponibles | 4 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| 4ᵉ | Realtime TTS 1.5 Mini | 1265 |
| 5ᵉ | Step TTS 2 (Mar 2026) | 1260 |
| 6ᵉ | Qwen-Audio-3.0-TTS-Plus | 1258 |
| 7ᵉ | Realtime TTS-2 - Research Preview | 1254 |
| 8ᵉ | Sonic 3.5 | 1223 |
Notre analyse
Forces. Qwen-Audio-3.0-TTS-Plus dispose de quatre voix, ce qui permet de varier les rendus ou d’attribuer des identités distinctes à plusieurs rôles. Son positionnement dans l’Arena text-to-speech montre qu’il reste proche du modèle en tête selon les préférences humaines. Il constitue ainsi une option crédible pour produire de la parole à partir de scripts écrits.
Limites et points d’attention. Le modèle reste derrière Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max et Luna TTS dans l’Arena. Son catalogue de quatre voix peut aussi restreindre la variété dans les productions qui font intervenir de nombreux personnages. Lorsque le classement Arena constitue le principal signal de sélection, Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max ou Luna TTS occupent une meilleure position. Les usages pertinents sont les voix off, les assistants vocaux, le doublage et l’accessibilité.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).