Polly Generative

Polly Generative est un modèle de synthèse vocale d’Amazon, lancé le 8 mai 2024. Il transforme du texte en parole et propose quatre voix, un choix resserré pour produire des contenus audio.

Polly Generative est un modèle de synthèse vocale d’Amazon, lancé le 8 mai 2024. Il transforme du texte en parole et propose quatre voix, un choix resserré pour produire des contenus audio.

Dans Arena text-to-speech, fondée sur la préférence humaine, le modèle se place dans le premier cinquième du classement. Il reste néanmoins nettement derrière Simba 3.2, qui occupe la tête, ce qui situe Polly Generative parmi les solutions bien classées sans en faire la référence actuelle.

Caractéristiques

CaractéristiqueValeur
TypeSynthèse vocale (text-to-speech)
ÉditeurAmazon
Poids🔒 Propriétaire
Date de sortie8 mai 2024
Voix disponibles4

Classements Arena (Elo)

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
20ᵉSimba 3.21151
21ᵉPolly Long-Form1151
22ᵉPolly Generative1150
23ᵉSpeech 2.61148
24ᵉFish Audio S2.1 Pro1148

Notre analyse

Forces. Le classement Arena indique une qualité vocale appréciée lors de comparaisons humaines, avec une position supérieure à celle de la grande majorité des modèles évalués. Les quatre voix disponibles permettent de varier les rendus tout en conservant une offre simple. Le positionnement est étayé par deux sources de données concordantes, ce qui renforce la fiabilité de cette lecture comparative.

Limites et points d’attention. Avec environ deux ans d’ancienneté, Polly Generative appartient à une génération déjà très ancienne à l’échelle de l’IA. Il doit donc être comparé aux modèles de sa période plutôt qu’aux meilleures solutions actuelles, qui ont probablement dépassé ses performances. Son écart avec la tête d’Arena confirme qu’il ne représente plus le niveau maximal observé en synthèse vocale. Les quatre voix constituent aussi une palette limitée pour les productions nécessitant de nombreux personnages ou identités vocales. Usages pertinents : voix off, assistants vocaux, doublage à distribution restreinte et contenus d’accessibilité fondés sur la lecture de texte.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).