Fish Audio S2 Pro

Fish Audio S2 Pro est un modèle de synthèse vocale publié par Fish Audio le 10 mars 2026. Il transforme du texte en parole dans plus de 80 langues et propose quatre voix, avec une prise en charge prioritaire du japonais, de l’anglais et du chinois.

Fish Audio S2 Pro est un modèle de synthèse vocale publié par Fish Audio le 10 mars 2026. Il transforme du texte en parole dans plus de 80 langues et propose quatre voix, avec une prise en charge prioritaire du japonais, de l’anglais et du chinois.

Le modèle se situe dans la partie haute de l’Arena text-to-speech, classement fondé sur la préférence humaine, derrière le modèle de tête Simba 3.2. Sa publication comprend les poids du modèle, le code de fine-tuning et un moteur d’inférence en streaming basé sur SGLang.

Caractéristiques

CaractéristiqueValeur
TypeSynthèse vocale (text-to-speech)
ÉditeurFish Audio
Poids🟢 Poids ouverts
Date de sortie10 mars 2026
Voix disponibles4

Classements Arena (Elo)

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
8ᵉSonic 3.51223
9ᵉAzure HD 2.51219
10ᵉFish Audio S2 Pro1214
11ᵉStepAudio 2.5 TTS1209
12ᵉStudio1206

Notre analyse

Forces. Fish Audio S2 Pro associe un transformer decoder-only à un codec audio RVQ. Son architecture Dual-Autoregressive répartit la génération entre un Slow AR et un Fast AR. Le modèle permet aussi de contrôler localement la prosodie et l’émotion grâce à des instructions en langage naturel insérées dans le texte avec la syntaxe [tag]. Sa présence dans la partie haute de l’Arena text-to-speech, au 12e rang sur 89, indique une appréciation humaine favorable de la parole produite. La couverture de plus de 80 langues élargit son champ d’application.

Limites et points d’attention. Le catalogue comprend quatre voix, ce qui restreint le choix de timbres pour les productions nécessitant de nombreux personnages ou identités vocales. Le japonais, l’anglais et le chinois disposent d’un statut Tier 1, ce qui établit une priorité explicite entre les langues prises en charge. Usages pertinents : voix off, assistants vocaux, doublage multilingue et outils d’accessibilité.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).