Fun-Realtime-TTS
Fun-Realtime-TTS est un modèle de synthèse vocale de Qwen, sorti le 28 mai 2026. Il transforme du texte en parole et propose huit voix.
Fun-Realtime-TTS est un modèle de synthèse vocale de Qwen, sorti le 28 mai 2026. Il transforme du texte en parole et propose huit voix.
Le modèle se place parmi les références de l’Arena text-to-speech, un classement fondé sur la préférence humaine. Sa deuxième place sur 89 modèles témoigne d’une réception particulièrement favorable lors des comparaisons directes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Qwen |
| Poids | ▫ n.d. |
| Date de sortie | 28 mai 2026 |
| Voix disponibles | 8 |
Notre analyse
Forces. Fun-Realtime-TTS occupe le haut du classement Arena text-to-speech, avec un Elo de 1254. Ce résultat constitue un signal solide de qualité perçue, car l’Arena repose sur des préférences humaines. Son catalogue de huit voix permet de sélectionner plusieurs rendus vocaux pour transformer des contenus écrits en parole. Le positionnement rapporté est confirmé par deux sources de données concordantes.
Limites et points d’attention. Le modèle reste derrière Simba 3.2, qui domine l’Arena avec un Elo de 1345. Ses huit voix forment par ailleurs un choix délimité pour les productions nécessitant de multiplier les identités vocales. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité des contenus textuels.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).