OpenAudio S1 Mini
OpenAudio S1 Mini est un modèle de synthèse vocale de Fish Audio, sorti le 3 juin 2025. Il transforme du texte en parole et propose quatre voix, notamment pour produire des voix off, alimenter des assistants vocaux, réaliser du doublage ou améliorer l’accessibilité de contenus écrits.
OpenAudio S1 Mini est un modèle de synthèse vocale de Fish Audio, sorti le 3 juin 2025. Il transforme du texte en parole et propose quatre voix, notamment pour produire des voix off, alimenter des assistants vocaux, réaliser du doublage ou améliorer l’accessibilité de contenus écrits.
Dans Arena text-to-speech, fondée sur la préférence humaine, le modèle se situe en retrait des références les mieux classées. Son ancienneté d’environ un an est déjà importante à l’échelle de l’IA, ce qui le rattache à une génération susceptible d’avoir été dépassée ou retirée du catalogue de l’éditeur.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Fish Audio |
| Poids | ▫ n.d. |
| Date de sortie | 3 juin 2025 |
| Voix disponibles | 4 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 65ᵉ | Kokoro 82M v1.0 | 1011 |
| 66ᵉ | SIMBA 1.0 | 1010 |
| 67ᵉ | OpenAudio S1 Mini | 1009 |
| 68ᵉ | Sonic English | 1006 |
| 69ᵉ | Polly Neural | 1001 |
Notre analyse
Forces. OpenAudio S1 Mini dispose d’une évaluation Arena fondée sur des comparaisons humaines, ce qui fournit un indicateur concret de la préférence accordée à ses sorties vocales. Ses quatre voix permettent de varier les rendus sans changer de modèle. Il peut ainsi servir à tester plusieurs identités vocales dans des productions parlées ou des interfaces reposant sur la lecture automatique de texte.
Limites et points d’attention. Son positionnement reste en retrait du classement Arena, derrière Simba 3.2, Gemini 3.1 Flash TTS et Realtime TTS-2 - Research Preview. Le choix limité à quatre voix réduit les possibilités de distribution vocale pour les projets nécessitant de nombreux personnages. L’évaluation repose sur une seule source de données concordante, tandis que son ancienneté élevée pour ce secteur augmente le risque d’un décalage avec les modèles plus récents. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité pour des projets acceptant ce positionnement, mais, pour un résultat plus abouti, on lui préférera Simba 3.2, Gemini 3.1 Flash TTS ou Realtime TTS-2 - Research Preview.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).