Polly Generative
Polly Generative est un modèle de synthèse vocale d’Amazon, lancé le 8 mai 2024. Il transforme du texte en parole et propose quatre voix, un choix resserré pour produire des contenus audio.
Polly Generative est un modèle de synthèse vocale d’Amazon, lancé le 8 mai 2024. Il transforme du texte en parole et propose quatre voix, un choix resserré pour produire des contenus audio.
Dans Arena text-to-speech, fondée sur la préférence humaine, le modèle se place dans le premier cinquième du classement. Il reste néanmoins nettement derrière Simba 3.2, qui occupe la tête, ce qui situe Polly Generative parmi les solutions bien classées sans en faire la référence actuelle.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Amazon |
| Poids | 🔒 Propriétaire |
| Date de sortie | 8 mai 2024 |
| Voix disponibles | 4 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 20ᵉ | Simba 3.2 | 1151 |
| 21ᵉ | Polly Long-Form | 1151 |
| 22ᵉ | Polly Generative | 1150 |
| 23ᵉ | Speech 2.6 | 1148 |
| 24ᵉ | Fish Audio S2.1 Pro | 1148 |
Notre analyse
Forces. Le classement Arena indique une qualité vocale appréciée lors de comparaisons humaines, avec une position supérieure à celle de la grande majorité des modèles évalués. Les quatre voix disponibles permettent de varier les rendus tout en conservant une offre simple. Le positionnement est étayé par deux sources de données concordantes, ce qui renforce la fiabilité de cette lecture comparative.
Limites et points d’attention. Avec environ deux ans d’ancienneté, Polly Generative appartient à une génération déjà très ancienne à l’échelle de l’IA. Il doit donc être comparé aux modèles de sa période plutôt qu’aux meilleures solutions actuelles, qui ont probablement dépassé ses performances. Son écart avec la tête d’Arena confirme qu’il ne représente plus le niveau maximal observé en synthèse vocale. Les quatre voix constituent aussi une palette limitée pour les productions nécessitant de nombreux personnages ou identités vocales. Usages pertinents : voix off, assistants vocaux, doublage à distribution restreinte et contenus d’accessibilité fondés sur la lecture de texte.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).