StepAudio 2.5 TTS

StepAudio 2.5 TTS est un modèle de synthèse vocale développé par StepFun et sorti le 30 avril 2026. Il transforme du texte en parole et propose trois voix.

StepAudio 2.5 TTS est un modèle de synthèse vocale développé par StepFun et sorti le 30 avril 2026. Il transforme du texte en parole et propose trois voix.

Le modèle se situe dans le haut du classement Arena text-to-speech, établi à partir de préférences humaines et d’un score Elo. Son positionnement repose sur deux sources de données concordantes, tout en restant derrière le modèle placé en tête, Simba 3.2.

Caractéristiques

CaractéristiqueValeur
TypeSynthèse vocale (text-to-speech)
ÉditeurStepFun
Poids▫ n.d.
Date de sortie30 avril 2026
Voix disponibles3

Classements Arena (Elo)

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
9ᵉAzure HD 2.51219
10ᵉFish Audio S2 Pro1214
11ᵉStepAudio 2.5 TTS1209
12ᵉStudio1206
13ᵉAsync Pro v1.01191

Notre analyse

Forces. StepAudio 2.5 TTS occupe la onzième place sur 89 modèles dans Arena text-to-speech. Ce résultat le place parmi les modèles les mieux classés de cette évaluation par préférence humaine. Les trois voix disponibles permettent de choisir entre plusieurs rendus vocaux pour un même texte.

Limites et points d'attention. Malgré son classement élevé, StepAudio 2.5 TTS reste en retrait par rapport à Simba 3.2, premier de l’Arena avec un Elo supérieur. Le choix limité à trois voix réduit aussi la diversité possible pour des productions nécessitant de nombreux personnages ou identités vocales. Usages pertinents : création de voix off, assistants vocaux, doublage avec un petit nombre de rôles et dispositifs d’accessibilité fondés sur la lecture de texte.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).