XTTS v2
XTTS v2 est un modèle de synthèse vocale publié par Coqui le 8 novembre 2023. Il transforme du texte en parole dans 17 langues et peut cloner une voix, y compris en translingue, à partir d’un extrait audio de six secondes.
XTTS v2 est un modèle de synthèse vocale publié par Coqui le 8 novembre 2023. Il transforme du texte en parole dans 17 langues et peut cloner une voix, y compris en translingue, à partir d’un extrait audio de six secondes.
Ancien à l’échelle de l’IA, il se situe en retrait du classement Arena face aux systèmes récents. Il reste accessible par l’API 🐸TTS, en ligne de commande ou directement dans du code, avec prise en charge de l’inférence et du fine-tuning.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Coqui |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 8 novembre 2023 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 82ᵉ | Mist V2 | 905 |
| 83ᵉ | StyleTTS 2 | 896 |
| 84ᵉ | XTTS v2 | 889 |
| 85ᵉ | LMNT | 868 |
| 86ᵉ | OpenVoice v2 | 849 |
Notre analyse
Forces. XTTS v2 associe génération multilingue et clonage vocal à partir d’une référence courte. Le clonage permet de transférer l’émotion et le style, tandis que plusieurs références de locuteurs peuvent être combinées avec interpolation. Le conditionnement du locuteur bénéficie d’améliorations architecturales par rapport à XTTS-v1. La sortie à 24 kHz et les différents modes d’accès facilitent son intégration dans une chaîne de production ou son adaptation par fine-tuning.
Limites et points d’attention. Son ancienneté d’environ trois ans est très importante à l’échelle de l’IA, ce qui le place probablement derrière des solutions plus récentes et peut expliquer son retrait de certains catalogues. Son classement Arena est faible, loin des modèles en tête comme Simba 3.2, Gemini 3.1 Flash TTS et Realtime TTS-2 - Research Preview. Il reste pertinent pour les équipes recherchant le clonage vocal multilingue, le transfert de style et une intégration flexible. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité, mais pour un résultat plus abouti, on lui préférera Simba 3.2, Gemini 3.1 Flash TTS ou Realtime TTS-2 - Research Preview.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).