XTTS v2

XTTS v2 est un modèle de synthèse vocale publié par Coqui le 8 novembre 2023. Il transforme du texte en parole dans 17 langues et peut cloner une voix, y compris en translingue, à partir d’un extrait audio de six secondes.

XTTS v2 est un modèle de synthèse vocale publié par Coqui le 8 novembre 2023. Il transforme du texte en parole dans 17 langues et peut cloner une voix, y compris en translingue, à partir d’un extrait audio de six secondes.

Ancien à l’échelle de l’IA, il se situe en retrait du classement Arena face aux systèmes récents. Il reste accessible par l’API 🐸TTS, en ligne de commande ou directement dans du code, avec prise en charge de l’inférence et du fine-tuning.

Caractéristiques

CaractéristiqueValeur
TypeSynthèse vocale (text-to-speech)
ÉditeurCoqui
Poids🟢 Poids ouverts
Date de sortie8 novembre 2023

Classements Arena (Elo)

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
82ᵉMist V2905
83ᵉStyleTTS 2896
84ᵉXTTS v2889
85ᵉLMNT868
86ᵉOpenVoice v2849

Notre analyse

Forces. XTTS v2 associe génération multilingue et clonage vocal à partir d’une référence courte. Le clonage permet de transférer l’émotion et le style, tandis que plusieurs références de locuteurs peuvent être combinées avec interpolation. Le conditionnement du locuteur bénéficie d’améliorations architecturales par rapport à XTTS-v1. La sortie à 24 kHz et les différents modes d’accès facilitent son intégration dans une chaîne de production ou son adaptation par fine-tuning.

Limites et points d’attention. Son ancienneté d’environ trois ans est très importante à l’échelle de l’IA, ce qui le place probablement derrière des solutions plus récentes et peut expliquer son retrait de certains catalogues. Son classement Arena est faible, loin des modèles en tête comme Simba 3.2, Gemini 3.1 Flash TTS et Realtime TTS-2 - Research Preview. Il reste pertinent pour les équipes recherchant le clonage vocal multilingue, le transfert de style et une intégration flexible. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité, mais pour un résultat plus abouti, on lui préférera Simba 3.2, Gemini 3.1 Flash TTS ou Realtime TTS-2 - Research Preview.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).