TTS-1
TTS-1 est un modèle de synthèse vocale propriétaire développé par OpenAI. Il transforme du texte en parole et propose cinq voix, un choix adapté à différents formats de production audio.
TTS-1 est un modèle de synthèse vocale propriétaire développé par OpenAI. Il transforme du texte en parole et propose cinq voix, un choix adapté à différents formats de production audio.
Le modèle occupe un positionnement tarifaire premium, tout en affichant une tarification inférieure de 89 % à la moyenne des modèles similaires. Ses poids ne sont pas ouverts, ce qui limite son exploitation aux modalités définies par OpenAI.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Voix disponibles | 5 |
| Modalités (entrée → sortie) | text → audio |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 24ᵉ | Fish Audio S2.1 Pro | 1148 |
| 25ᵉ | Gemini 2.5 Flash TTS (Dec 2025) | 1141 |
| 26ᵉ | TTS-1 | 1139 |
| 27ᵉ | Speech 02 HD | 1130 |
| 28ᵉ | Maya1 | 1127 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| openai | 3,75e+06 $ | n.d. | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 89 % en dessous de la moyenne des modèles similaires.
Notre analyse
Forces. TTS-1 couvre les principaux usages de la synthèse vocale avec cinq voix disponibles. Son coût inférieur à la moyenne de sa catégorie peut intéresser les équipes qui souhaitent produire des contenus parlés tout en maîtrisant leur budget. Son classement Arena repose sur des préférences humaines, un indicateur directement lié au rendu perçu lors des écoutes comparatives.
Limites et points d'attention. TTS-1 se situe en retrait dans l'Arena text-to-speech, au 29e rang sur 88. Il se place derrière Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max et Luna TTS. L'écart d'environ 170 points Elo avec le premier est important : Gemini 3.1 Flash TTS est nettement devant dans les duels de préférence humaine. La licence propriétaire et les poids fermés restreignent aussi les possibilités de déploiement autonome. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité ; pour un résultat plus abouti, on lui préférera Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max ou Luna TTS.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).