TTS-1

TTS-1 est un modèle de synthèse vocale propriétaire développé par OpenAI. Il transforme du texte en parole et propose cinq voix, un choix adapté à différents formats de production audio.

TTS-1 est un modèle de synthèse vocale propriétaire développé par OpenAI. Il transforme du texte en parole et propose cinq voix, un choix adapté à différents formats de production audio.

Le modèle occupe un positionnement tarifaire premium, tout en affichant une tarification inférieure de 89 % à la moyenne des modèles similaires. Ses poids ne sont pas ouverts, ce qui limite son exploitation aux modalités définies par OpenAI.

Caractéristiques

CaractéristiqueValeur
TypeSynthèse vocale (text-to-speech)
ÉditeurOpenAI
Poids🔒 Propriétaire
Voix disponibles5
Modalités (entrée → sortie)text → audio

Classements Arena (Elo)

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
24ᵉFish Audio S2.1 Pro1148
25ᵉGemini 2.5 Flash TTS (Dec 2025)1141
26ᵉTTS-11139
27ᵉSpeech 02 HD1130
28ᵉMaya11127

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
openai3,75e+06 $n.d.n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 89 % en dessous de la moyenne des modèles similaires.

Notre analyse

Forces. TTS-1 couvre les principaux usages de la synthèse vocale avec cinq voix disponibles. Son coût inférieur à la moyenne de sa catégorie peut intéresser les équipes qui souhaitent produire des contenus parlés tout en maîtrisant leur budget. Son classement Arena repose sur des préférences humaines, un indicateur directement lié au rendu perçu lors des écoutes comparatives.

Limites et points d'attention. TTS-1 se situe en retrait dans l'Arena text-to-speech, au 29e rang sur 88. Il se place derrière Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max et Luna TTS. L'écart d'environ 170 points Elo avec le premier est important : Gemini 3.1 Flash TTS est nettement devant dans les duels de préférence humaine. La licence propriétaire et les poids fermés restreignent aussi les possibilités de déploiement autonome. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité ; pour un résultat plus abouti, on lui préférera Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max ou Luna TTS.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).