TTS-1 HD
TTS-1 HD est un modèle de synthèse vocale publié par OpenAI le 6 novembre 2023. Il transforme du texte en parole et propose cinq voix, ce qui permet de varier l’identité vocale selon les contenus produits.
TTS-1 HD est un modèle de synthèse vocale publié par OpenAI le 6 novembre 2023. Il transforme du texte en parole et propose cinq voix, ce qui permet de varier l’identité vocale selon les contenus produits.
Dans l’Arena text-to-speech, fondée sur les préférences humaines, le modèle se situe dans la première partie du classement, tout en restant derrière le modèle de tête, Simba 3.2. Son positionnement repose sur deux sources de données concordantes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Voix disponibles | 5 |
| Modalités (entrée → sortie) | text → audio |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 14ᵉ | Lightning V3.1 Pro TTS (Jun 2026) | 1176 |
| 15ᵉ | Async Flash v1.5 | 1176 |
| 16ᵉ | TTS-1 HD | 1173 |
| 17ᵉ | SIMBA 3.0 | 1170 |
| 18ᵉ | Octave TTS | 1166 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| openai | 7,5e+06 $ | n.d. | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 79 % en dessous de la moyenne des modèles similaires.
Notre analyse
Forces. TTS-1 HD conserve un positionnement solide dans l’Arena text-to-speech, avec une place parmi les modèles les mieux classés sur un ensemble de 89 concurrents. Cette évaluation par préférence humaine constitue un indicateur utile de la qualité perçue de la parole produite. Les cinq voix disponibles permettent d’adapter l’identité sonore à plusieurs types de contenus sans changer de modèle.
Limites et points d’attention. Sorti en novembre 2023, TTS-1 HD approche trois ans d’ancienneté, une durée très longue à l’échelle de l’IA. Il doit donc être replacé parmi les modèles de sa période plutôt que face aux systèmes les plus récents. Il est probablement dépassé et peut avoir été retiré du catalogue actuel de l’éditeur. Son écart avec Simba 3.2 confirme aussi qu’il n’occupe plus la tête de l’Arena. Usages pertinents : voix off, assistants vocaux, doublage et dispositifs d’accessibilité fondés sur la lecture de texte.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).