Step TTS 2 (Mar 2026)

Publié le 12 février 2026 par StepFun, Step TTS 2 (Mar 2026) est un modèle de synthèse vocale qui transforme du texte en parole. Il propose deux voix, un choix resserré pour produire des contenus parlés avec deux rendus distincts.

Publié le 12 février 2026 par StepFun, Step TTS 2 (Mar 2026) est un modèle de synthèse vocale qui transforme du texte en parole. Il propose deux voix, un choix resserré pour produire des contenus parlés avec deux rendus distincts.

Il occupe le haut du classement Arena text-to-speech, derrière Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max et Luna TTS. L’écart avec Gemini 3.1 Flash TTS est faible, et les deux modèles restent proches en préférence humaine.

Caractéristiques

CaractéristiqueValeur
TypeSynthèse vocale (text-to-speech)
ÉditeurStepFun
Poids▫ n.d.
Date de sortie12 février 2026
Voix disponibles2

Classements Arena (Elo)

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
4ᵉRealtime TTS 1.5 Mini1265
5ᵉStep TTS 2 (Mar 2026)1260
6ᵉQwen-Audio-3.0-TTS-Plus1258
7ᵉRealtime TTS-2 - Research Preview1254

Notre analyse

Forces. Sa septième place sur 88 dans Arena situe Step TTS 2 parmi les modèles de synthèse vocale les mieux classés. Ce résultat apporte un signal favorable fondé sur la préférence humaine. Sa proximité avec Gemini 3.1 Flash TTS montre qu’il reste compétitif face au premier de l’Arena. Les deux voix disponibles permettent de choisir entre deux identités vocales sans changer de modèle.

Limites et points d’attention. Le choix de deux voix limite la variété disponible pour les productions qui demandent de nombreux personnages ou une distribution vocale étendue. Step TTS 2 reste derrière Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max et Luna TTS dans Arena. Son catalogue vocal convient donc davantage aux projets concentrés sur un petit nombre de voix. Usages pertinents : voix off, assistants vocaux, doublage avec peu de personnages et dispositifs d’accessibilité fondés sur la lecture à voix haute.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).