OpenVoice v2
OpenVoice v2 est un modèle de synthèse vocale publié par OpenVoice le 1er avril 2024. Il transforme du texte en parole et peut reproduire la couleur de ton d’une voix de référence, y compris entre différentes langues sans entraînement préalable.
OpenVoice v2 est un modèle de synthèse vocale publié par OpenVoice le 1er avril 2024. Il transforme du texte en parole et peut reproduire la couleur de ton d’une voix de référence, y compris entre différentes langues sans entraînement préalable.
Âgé de près de deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA. Son positionnement dans l’Arena text-to-speech est en retrait, loin des modèles actuellement en tête. Son fonctionnement repose sur le checkpoint V2 et sur MeloTTS.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | OpenVoice |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 1 avril 2024 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 84ᵉ | XTTS v2 | 889 |
| 85ᵉ | LMNT | 868 |
| 86ᵉ | OpenVoice v2 | 849 |
| 87ᵉ | Polly Standard | 825 |
| 88ᵉ | MetaVoice v1 | 771 |
Notre analyse
Forces. OpenVoice v2 reprend les fonctions de la première version avec une stratégie d’entraînement différente, destinée à améliorer la qualité audio. Il prend nativement en charge l’anglais, l’espagnol, le français, le chinois, le japonais et le coréen. La voix de référence peut provenir d’un enregistrement dans n’importe quelle langue, tandis que le clonage vocal cross-lingual zero-shot permet de produire une autre langue. Le contrôle porte aussi sur l’émotion, l’accent, le rythme, les pauses et l’intonation.
Limites et points d’attention. Le modèle se situe en retrait du classement Arena, derrière les références récentes, ce qui traduit une préférence humaine globalement faible face aux autres modèles évalués. Son ancienneté est très importante dans ce domaine et le place probablement derrière les solutions contemporaines en matière de rendu. Il reste pertinent pour expérimenter le clonage vocal multilingue et le contrôle expressif. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité ; pour un résultat plus abouti, on lui préférera Simba 3.2, Gemini 3.1 Flash TTS ou Realtime TTS-2 - Research Preview.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).