StepAudio 2.5 TTS
StepAudio 2.5 TTS est un modèle de synthèse vocale développé par StepFun et sorti le 30 avril 2026. Il transforme du texte en parole et propose trois voix.
StepAudio 2.5 TTS est un modèle de synthèse vocale développé par StepFun et sorti le 30 avril 2026. Il transforme du texte en parole et propose trois voix.
Le modèle se situe dans le haut du classement Arena text-to-speech, établi à partir de préférences humaines et d’un score Elo. Son positionnement repose sur deux sources de données concordantes, tout en restant derrière le modèle placé en tête, Simba 3.2.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | StepFun |
| Poids | ▫ n.d. |
| Date de sortie | 30 avril 2026 |
| Voix disponibles | 3 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 9ᵉ | Azure HD 2.5 | 1219 |
| 10ᵉ | Fish Audio S2 Pro | 1214 |
| 11ᵉ | StepAudio 2.5 TTS | 1209 |
| 12ᵉ | Studio | 1206 |
| 13ᵉ | Async Pro v1.0 | 1191 |
Notre analyse
Forces. StepAudio 2.5 TTS occupe la onzième place sur 89 modèles dans Arena text-to-speech. Ce résultat le place parmi les modèles les mieux classés de cette évaluation par préférence humaine. Les trois voix disponibles permettent de choisir entre plusieurs rendus vocaux pour un même texte.
Limites et points d'attention. Malgré son classement élevé, StepAudio 2.5 TTS reste en retrait par rapport à Simba 3.2, premier de l’Arena avec un Elo supérieur. Le choix limité à trois voix réduit aussi la diversité possible pour des productions nécessitant de nombreux personnages ou identités vocales. Usages pertinents : création de voix off, assistants vocaux, doublage avec un petit nombre de rôles et dispositifs d’accessibilité fondés sur la lecture de texte.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).