Fish Audio S2 Pro
Fish Audio S2 Pro est un modèle de synthèse vocale publié par Fish Audio le 10 mars 2026. Il transforme du texte en parole dans plus de 80 langues et propose quatre voix, avec une prise en charge prioritaire du japonais, de l’anglais et du chinois.
Fish Audio S2 Pro est un modèle de synthèse vocale publié par Fish Audio le 10 mars 2026. Il transforme du texte en parole dans plus de 80 langues et propose quatre voix, avec une prise en charge prioritaire du japonais, de l’anglais et du chinois.
Le modèle se situe dans la partie haute de l’Arena text-to-speech, classement fondé sur la préférence humaine, derrière le modèle de tête Simba 3.2. Sa publication comprend les poids du modèle, le code de fine-tuning et un moteur d’inférence en streaming basé sur SGLang.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Fish Audio |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 10 mars 2026 |
| Voix disponibles | 4 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 8ᵉ | Sonic 3.5 | 1223 |
| 9ᵉ | Azure HD 2.5 | 1219 |
| 10ᵉ | Fish Audio S2 Pro | 1214 |
| 11ᵉ | StepAudio 2.5 TTS | 1209 |
| 12ᵉ | Studio | 1206 |
Notre analyse
Forces. Fish Audio S2 Pro associe un transformer decoder-only à un codec audio RVQ. Son architecture Dual-Autoregressive répartit la génération entre un Slow AR et un Fast AR. Le modèle permet aussi de contrôler localement la prosodie et l’émotion grâce à des instructions en langage naturel insérées dans le texte avec la syntaxe [tag]. Sa présence dans la partie haute de l’Arena text-to-speech, au 12e rang sur 89, indique une appréciation humaine favorable de la parole produite. La couverture de plus de 80 langues élargit son champ d’application.
Limites et points d’attention. Le catalogue comprend quatre voix, ce qui restreint le choix de timbres pour les productions nécessitant de nombreux personnages ou identités vocales. Le japonais, l’anglais et le chinois disposent d’un statut Tier 1, ce qui établit une priorité explicite entre les langues prises en charge. Usages pertinents : voix off, assistants vocaux, doublage multilingue et outils d’accessibilité.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).