Speech 02 HD

Speech-02-HD est un modèle de synthèse vocale de MiniMax, sorti le 31 mars 2025. Il transforme du texte en parole et propose deux voix, un choix restreint qui le destine surtout aux productions ne nécessitant pas une grande diversité vocale.

Speech-02-HD est un modèle de synthèse vocale de MiniMax, sorti le 31 mars 2025. Il transforme du texte en parole et propose deux voix, un choix restreint qui le destine surtout aux productions ne nécessitant pas une grande diversité vocale.

Dans Arena text-to-speech, il se situe dans le haut du classement selon les préférences humaines, tout en restant derrière le modèle de tête, Simba 3.2. Sa position repose sur deux sources de données concordantes, ce qui renforce la fiabilité de cette évaluation comparative.

Caractéristiques

CaractéristiqueValeur
TypeSynthèse vocale (text-to-speech)
ÉditeurMiniMax
Poids🔒 Propriétaire
Voix disponibles2
Modalités (entrée → sortie)text → audio

Classements Arena (Elo)

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
25ᵉGemini 2.5 Flash TTS (Dec 2025)1141
26ᵉTTS-11139
27ᵉSpeech 02 HD1130
28ᵉMaya11127
29ᵉGemini 2.5 Flash Lite TTS1125

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
minimax3,75e+08 $n.d.n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 954 % au-dessus de la moyenne des modèles similaires.

Notre analyse

Forces. Speech-02-HD conserve un positionnement compétitif dans Arena text-to-speech, où son classement le place parmi les modèles bien évalués par préférence humaine. Ce signal indique que ses sorties vocales ont été favorablement comparées à celles d’une large sélection de systèmes concurrents. La concordance de deux sources de données consolide ce constat. Son catalogue de deux voix peut convenir à des projets dont l’identité sonore repose sur un nombre limité de profils vocaux.

Limites et points d'attention. Avec environ un an d’ancienneté, Speech-02-HD est déjà très ancien à l’échelle de l’IA et doit être comparé aux modèles de sa période plutôt qu’aux solutions les plus récentes. Il est probablement dépassé par de nouvelles générations, tandis que son écart avec Simba 3.2 montre qu’il n’occupe pas la tête d’Arena. Les deux voix disponibles limitent aussi la variété des personnages, des registres ou des identités sonores. Usages pertinents : voix off, assistants vocaux, doublage à distribution réduite et outils d’accessibilité fondés sur la lecture de texte.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).