Realtime TTS 1.5 Max

Realtime TTS 1.5 Max est un modèle de synthèse vocale publié par Inworld le 21 janvier 2026. Il transforme du texte en parole et propose quatre voix.

Realtime TTS 1.5 Max est un modèle de synthèse vocale publié par Inworld le 21 janvier 2026. Il transforme du texte en parole et propose quatre voix.

Il occupe la deuxième place de l’Arena text-to-speech, derrière Gemini 3.1 Flash TTS et devant Luna TTS ainsi que Realtime TTS 1.5 Mini. Les deux premiers modèles sont proches en préférence humaine.

Caractéristiques

CaractéristiqueValeur
TypeSynthèse vocale (text-to-speech)
ÉditeurInworld
Poids🔒 Propriétaire
Date de sortie21 janvier 2026
Voix disponibles4

Classements Arena (Elo)

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
4ᵉRealtime TTS 1.5 Mini1265

Notre analyse

Forces. Son rang dans l’Arena place Realtime TTS 1.5 Max parmi les modèles de synthèse vocale les plus appréciés lors des évaluations humaines. Il devance Luna TTS et la déclinaison Realtime TTS 1.5 Mini. Ses quatre voix permettent de varier les rendus au sein d’un même projet.

Limites et points d’attention. Le catalogue de quatre voix restreint la diversité disponible pour les productions qui nécessitent de nombreux personnages ou identités vocales. Gemini 3.1 Flash TTS conserve la première place, avec une faible avance en préférence humaine. Le choix entre ces deux modèles peut donc dépendre du rendu recherché pour chaque production. Usages pertinents : voix off, assistants vocaux, doublage et dispositifs d’accessibilité fondés sur la lecture de texte.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).