OpenVoice v2

OpenVoice v2 est un modèle de synthèse vocale publié par OpenVoice le 1er avril 2024. Il transforme du texte en parole et peut reproduire la couleur de ton d’une voix de référence, y compris entre différentes langues sans entraînement préalable.

OpenVoice v2 est un modèle de synthèse vocale publié par OpenVoice le 1er avril 2024. Il transforme du texte en parole et peut reproduire la couleur de ton d’une voix de référence, y compris entre différentes langues sans entraînement préalable.

Âgé de près de deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA. Son positionnement dans l’Arena text-to-speech est en retrait, loin des modèles actuellement en tête. Son fonctionnement repose sur le checkpoint V2 et sur MeloTTS.

Caractéristiques

CaractéristiqueValeur
TypeSynthèse vocale (text-to-speech)
ÉditeurOpenVoice
Poids🟢 Poids ouverts
Date de sortie1 avril 2024

Classements Arena (Elo)

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
84ᵉXTTS v2889
85ᵉLMNT868
86ᵉOpenVoice v2849
87ᵉPolly Standard825
88ᵉMetaVoice v1771

Notre analyse

Forces. OpenVoice v2 reprend les fonctions de la première version avec une stratégie d’entraînement différente, destinée à améliorer la qualité audio. Il prend nativement en charge l’anglais, l’espagnol, le français, le chinois, le japonais et le coréen. La voix de référence peut provenir d’un enregistrement dans n’importe quelle langue, tandis que le clonage vocal cross-lingual zero-shot permet de produire une autre langue. Le contrôle porte aussi sur l’émotion, l’accent, le rythme, les pauses et l’intonation.

Limites et points d’attention. Le modèle se situe en retrait du classement Arena, derrière les références récentes, ce qui traduit une préférence humaine globalement faible face aux autres modèles évalués. Son ancienneté est très importante dans ce domaine et le place probablement derrière les solutions contemporaines en matière de rendu. Il reste pertinent pour expérimenter le clonage vocal multilingue et le contrôle expressif. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité ; pour un résultat plus abouti, on lui préférera Simba 3.2, Gemini 3.1 Flash TTS ou Realtime TTS-2 - Research Preview.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).