Polly Long-Form
Polly Long-Form est un modèle de synthèse vocale d’Amazon, sorti le 16 novembre 2023. Il transforme du texte en parole et propose trois voix, un choix limité mais exploitable pour plusieurs formats audio.
Polly Long-Form est un modèle de synthèse vocale d’Amazon, sorti le 16 novembre 2023. Il transforme du texte en parole et propose trois voix, un choix limité mais exploitable pour plusieurs formats audio.
Dans l’Arena text-to-speech, il se situe dans la partie haute du classement sans atteindre le groupe de tête. Il se place derrière Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max et Luna TTS. Le premier est nettement devant en préférence humaine.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Amazon |
| Poids | 🔒 Propriétaire |
| Date de sortie | 16 novembre 2023 |
| Voix disponibles | 3 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 19ᵉ | MiMo-V2.5-TTS | 1156 |
| 20ᵉ | Simba 3.2 | 1151 |
| 21ᵉ | Polly Long-Form | 1151 |
| 22ᵉ | Polly Generative | 1150 |
| 23ᵉ | Speech 2.6 | 1148 |
Notre analyse
Forces. Son positionnement dans l’Arena indique une qualité perçue encore compétitive face à de nombreux modèles de synthèse vocale. Les trois voix permettent de varier les rendus sur des productions simples. Polly Long-Form peut ainsi servir à produire une narration, une voix d’interface ou une lecture audio.
Limites et points d’attention. Son ancienneté est très importante à l’échelle de l’IA. Le modèle est probablement dépassé par des systèmes plus récents, et les offres de cette période sont souvent retirées des catalogues des éditeurs. Le choix de trois voix limite aussi la diversité pour le doublage à plusieurs personnages ou les projets qui exigent une distribution vocale étendue. Usages pertinents : voix off, assistants vocaux, doublage simple et accessibilité ; pour un résultat plus abouti, on lui préférera Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max ou Luna TTS.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).