Realtime TTS-2 - Research Preview
Realtime TTS-2 - Research Preview est un modèle de synthèse vocale d’Inworld, sorti le 5 mai 2026. Il transforme du texte en parole et propose huit voix.
Realtime TTS-2 - Research Preview est un modèle de synthèse vocale d’Inworld, sorti le 5 mai 2026. Il transforme du texte en parole et propose huit voix.
Dans l’Arena text-to-speech, fondée sur la préférence humaine et un classement Elo, le modèle se positionne derrière le leader Simba 3.2. Cette évaluation est corroborée par deux sources de données concordantes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Inworld |
| Poids | 🔒 Propriétaire |
| Date de sortie | 5 mai 2026 |
| Voix disponibles | 8 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 5ᵉ | Step TTS 2 (Mar 2026) | 1260 |
| 6ᵉ | Qwen-Audio-3.0-TTS-Plus | 1258 |
| 7ᵉ | Realtime TTS-2 - Research Preview | 1254 |
| 8ᵉ | Sonic 3.5 | 1223 |
| 9ᵉ | Azure HD 2.5 | 1219 |
Notre analyse
Forces. Realtime TTS-2 - Research Preview se distingue par un positionnement élevé dans l’Arena text-to-speech, même s’il ne prend pas la tête du classement. Ses huit voix permettent de varier les rendus vocaux selon les productions, tandis que l’évaluation par préférence humaine apporte un indicateur directement lié à la perception des auditeurs.
Limites et points d’attention. Le modèle reste devancé par Simba 3.2 dans l’Arena. Son appellation « Research Preview » le présente comme une version de recherche, un statut à prendre en compte lors de son évaluation. Usages pertinents : création de voix off, assistants vocaux, doublage et solutions d’accessibilité fondées sur la lecture de texte.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).