Realtime TTS-2 - Research Preview

Realtime TTS-2 - Research Preview est un modèle de synthèse vocale d’Inworld, sorti le 5 mai 2026. Il transforme du texte en parole et propose huit voix.

Realtime TTS-2 - Research Preview est un modèle de synthèse vocale d’Inworld, sorti le 5 mai 2026. Il transforme du texte en parole et propose huit voix.

Dans l’Arena text-to-speech, fondée sur la préférence humaine et un classement Elo, le modèle se positionne derrière le leader Simba 3.2. Cette évaluation est corroborée par deux sources de données concordantes.

Caractéristiques

CaractéristiqueValeur
TypeSynthèse vocale (text-to-speech)
ÉditeurInworld
Poids🔒 Propriétaire
Date de sortie5 mai 2026
Voix disponibles8

Classements Arena (Elo)

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
5ᵉStep TTS 2 (Mar 2026)1260
6ᵉQwen-Audio-3.0-TTS-Plus1258
7ᵉRealtime TTS-2 - Research Preview1254
8ᵉSonic 3.51223
9ᵉAzure HD 2.51219

Notre analyse

Forces. Realtime TTS-2 - Research Preview se distingue par un positionnement élevé dans l’Arena text-to-speech, même s’il ne prend pas la tête du classement. Ses huit voix permettent de varier les rendus vocaux selon les productions, tandis que l’évaluation par préférence humaine apporte un indicateur directement lié à la perception des auditeurs.

Limites et points d’attention. Le modèle reste devancé par Simba 3.2 dans l’Arena. Son appellation « Research Preview » le présente comme une version de recherche, un statut à prendre en compte lors de son évaluation. Usages pertinents : création de voix off, assistants vocaux, doublage et solutions d’accessibilité fondées sur la lecture de texte.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).