TTS-1 HD

TTS-1 HD est un modèle de synthèse vocale publié par OpenAI le 6 novembre 2023. Il transforme du texte en parole et propose cinq voix, ce qui permet de varier l’identité vocale selon les contenus produits.

TTS-1 HD est un modèle de synthèse vocale publié par OpenAI le 6 novembre 2023. Il transforme du texte en parole et propose cinq voix, ce qui permet de varier l’identité vocale selon les contenus produits.

Dans l’Arena text-to-speech, fondée sur les préférences humaines, le modèle se situe dans la première partie du classement, tout en restant derrière le modèle de tête, Simba 3.2. Son positionnement repose sur deux sources de données concordantes.

Caractéristiques

CaractéristiqueValeur
TypeSynthèse vocale (text-to-speech)
ÉditeurOpenAI
Poids🔒 Propriétaire
Voix disponibles5
Modalités (entrée → sortie)text → audio

Classements Arena (Elo)

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
14ᵉLightning V3.1 Pro TTS (Jun 2026)1176
15ᵉAsync Flash v1.51176
16ᵉTTS-1 HD1173
17ᵉSIMBA 3.01170
18ᵉOctave TTS1166

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
openai7,5e+06 $n.d.n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 79 % en dessous de la moyenne des modèles similaires.

Notre analyse

Forces. TTS-1 HD conserve un positionnement solide dans l’Arena text-to-speech, avec une place parmi les modèles les mieux classés sur un ensemble de 89 concurrents. Cette évaluation par préférence humaine constitue un indicateur utile de la qualité perçue de la parole produite. Les cinq voix disponibles permettent d’adapter l’identité sonore à plusieurs types de contenus sans changer de modèle.

Limites et points d’attention. Sorti en novembre 2023, TTS-1 HD approche trois ans d’ancienneté, une durée très longue à l’échelle de l’IA. Il doit donc être replacé parmi les modèles de sa période plutôt que face aux systèmes les plus récents. Il est probablement dépassé et peut avoir été retiré du catalogue actuel de l’éditeur. Son écart avec Simba 3.2 confirme aussi qu’il n’occupe plus la tête de l’Arena. Usages pertinents : voix off, assistants vocaux, doublage et dispositifs d’accessibilité fondés sur la lecture de texte.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).