Qwen3 TTS Flash
Qwen3 TTS Flash est un modèle de synthèse vocale publié par Qwen le 22 septembre 2025. Il transforme du texte en parole et propose quatre voix, ce qui permet de varier les rendus vocaux selon les productions.
Qwen3 TTS Flash est un modèle de synthèse vocale publié par Qwen le 22 septembre 2025. Il transforme du texte en parole et propose quatre voix, ce qui permet de varier les rendus vocaux selon les productions.
Dans l’Arena text-to-speech, fondée sur la préférence humaine, le modèle se place en retrait du classement. Son positionnement le situe notamment derrière Simba 3.2, Gemini 3.1 Flash TTS et Realtime TTS-2 - Research Preview.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Qwen |
| Poids | ▫ n.d. |
| Date de sortie | 22 septembre 2025 |
| Voix disponibles | 4 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 70ᵉ | Zonos-v0.1 | 1000 |
| 71ᵉ | Chatterbox | 997 |
| 72ᵉ | Qwen3 TTS Flash | 994 |
| 73ᵉ | Neuphonic TTS | 987 |
| 74ᵉ | Octave 2 | 983 |
Notre analyse
Forces. Qwen3 TTS Flash fournit quatre voix pour convertir des contenus écrits en parole. Cette diversité est exploitable pour distinguer plusieurs intervenants ou adapter une production vocale à différents formats. Son évaluation dans l’Arena text-to-speech apporte un signal de qualité issu de préférences humaines, avec un positionnement confirmé par deux sources de données concordantes.
Limites et points d’attention. Son rang dans la seconde moitié de l’Arena indique un niveau de préférence inférieur à celui des modèles placés en tête. Il reste pertinent pour des projets qui souhaitent tester les voix proposées ou produire une première version audio, mais son classement invite à comparer directement le rendu avec des solutions mieux évaluées. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité ; pour un résultat plus abouti, on lui préférera Simba 3.2, Gemini 3.1 Flash TTS ou Realtime TTS-2 - Research Preview.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).