OpenAudio S1 Mini

OpenAudio S1 Mini est un modèle de synthèse vocale de Fish Audio, sorti le 3 juin 2025. Il transforme du texte en parole et propose quatre voix, notamment pour produire des voix off, alimenter des assistants vocaux, réaliser du doublage ou améliorer l’accessibilité de contenus écrits.

OpenAudio S1 Mini est un modèle de synthèse vocale de Fish Audio, sorti le 3 juin 2025. Il transforme du texte en parole et propose quatre voix, notamment pour produire des voix off, alimenter des assistants vocaux, réaliser du doublage ou améliorer l’accessibilité de contenus écrits.

Dans Arena text-to-speech, fondée sur la préférence humaine, le modèle se situe en retrait des références les mieux classées. Son ancienneté d’environ un an est déjà importante à l’échelle de l’IA, ce qui le rattache à une génération susceptible d’avoir été dépassée ou retirée du catalogue de l’éditeur.

Caractéristiques

CaractéristiqueValeur
TypeSynthèse vocale (text-to-speech)
ÉditeurFish Audio
Poids▫ n.d.
Date de sortie3 juin 2025
Voix disponibles4

Classements Arena (Elo)

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
65ᵉKokoro 82M v1.01011
66ᵉSIMBA 1.01010
67ᵉOpenAudio S1 Mini1009
68ᵉSonic English1006
69ᵉPolly Neural1001

Notre analyse

Forces. OpenAudio S1 Mini dispose d’une évaluation Arena fondée sur des comparaisons humaines, ce qui fournit un indicateur concret de la préférence accordée à ses sorties vocales. Ses quatre voix permettent de varier les rendus sans changer de modèle. Il peut ainsi servir à tester plusieurs identités vocales dans des productions parlées ou des interfaces reposant sur la lecture automatique de texte.

Limites et points d’attention. Son positionnement reste en retrait du classement Arena, derrière Simba 3.2, Gemini 3.1 Flash TTS et Realtime TTS-2 - Research Preview. Le choix limité à quatre voix réduit les possibilités de distribution vocale pour les projets nécessitant de nombreux personnages. L’évaluation repose sur une seule source de données concordante, tandis que son ancienneté élevée pour ce secteur augmente le risque d’un décalage avec les modèles plus récents. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité pour des projets acceptant ce positionnement, mais, pour un résultat plus abouti, on lui préférera Simba 3.2, Gemini 3.1 Flash TTS ou Realtime TTS-2 - Research Preview.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).