Fish Audio S2.1 Pro
Fish Audio S2.1 Pro est un modèle de synthèse vocale développé par Fish Audio et sorti le 23 juin 2026. Il transforme du texte en parole et propose huit voix, ce qui permet de varier les rendus selon les productions.
Fish Audio S2.1 Pro est un modèle de synthèse vocale développé par Fish Audio et sorti le 23 juin 2026. Il transforme du texte en parole et propose huit voix, ce qui permet de varier les rendus selon les productions.
Dans l’Arena text-to-speech, fondée sur la préférence humaine, le modèle se situe dans la partie haute du classement, tout en restant derrière les solutions les mieux positionnées. Il peut servir à produire des voix off, à créer des assistants vocaux, à réaliser du doublage ou à vocaliser des contenus à des fins d’accessibilité.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Fish Audio |
| Poids | ▫ n.d. |
| Date de sortie | 23 juin 2026 |
| Voix disponibles | 8 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 22ᵉ | Polly Generative | 1150 |
| 23ᵉ | Speech 2.6 | 1148 |
| 24ᵉ | Fish Audio S2.1 Pro | 1148 |
| 25ᵉ | Gemini 2.5 Flash TTS (Dec 2025) | 1141 |
| 26ᵉ | TTS-1 | 1139 |
Notre analyse
Forces. Fish Audio S2.1 Pro réunit huit voix dans un même modèle de text-to-speech. Son positionnement dans la partie haute de l’Arena indique une préférence humaine favorable par rapport à une large majorité des modèles évalués. Cette diversité de voix facilite la sélection d’un rendu adapté à plusieurs types de contenus parlés, sans limiter le modèle à un seul registre d’utilisation.
Limites et points d’attention. Le modèle reste en retrait des leaders de l’Arena, notamment Simba 3.2, Gemini 3.1 Flash TTS et Realtime TTS-2 - Research Preview. Son évaluation repose sur une seule source de données concordante, ce qui invite à compléter le classement par des essais sur les textes et les voix visés. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité ; pour un résultat plus abouti, on lui préférera Simba 3.2, Gemini 3.1 Flash TTS ou Realtime TTS-2 - Research Preview.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).