Speech 02 HD
Speech-02-HD est un modèle de synthèse vocale de MiniMax, sorti le 31 mars 2025. Il transforme du texte en parole et propose deux voix, un choix restreint qui le destine surtout aux productions ne nécessitant pas une grande diversité vocale.
Speech-02-HD est un modèle de synthèse vocale de MiniMax, sorti le 31 mars 2025. Il transforme du texte en parole et propose deux voix, un choix restreint qui le destine surtout aux productions ne nécessitant pas une grande diversité vocale.
Dans Arena text-to-speech, il se situe dans le haut du classement selon les préférences humaines, tout en restant derrière le modèle de tête, Simba 3.2. Sa position repose sur deux sources de données concordantes, ce qui renforce la fiabilité de cette évaluation comparative.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | MiniMax |
| Poids | 🔒 Propriétaire |
| Voix disponibles | 2 |
| Modalités (entrée → sortie) | text → audio |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 25ᵉ | Gemini 2.5 Flash TTS (Dec 2025) | 1141 |
| 26ᵉ | TTS-1 | 1139 |
| 27ᵉ | Speech 02 HD | 1130 |
| 28ᵉ | Maya1 | 1127 |
| 29ᵉ | Gemini 2.5 Flash Lite TTS | 1125 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| minimax | 3,75e+08 $ | n.d. | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 954 % au-dessus de la moyenne des modèles similaires.
Notre analyse
Forces. Speech-02-HD conserve un positionnement compétitif dans Arena text-to-speech, où son classement le place parmi les modèles bien évalués par préférence humaine. Ce signal indique que ses sorties vocales ont été favorablement comparées à celles d’une large sélection de systèmes concurrents. La concordance de deux sources de données consolide ce constat. Son catalogue de deux voix peut convenir à des projets dont l’identité sonore repose sur un nombre limité de profils vocaux.
Limites et points d'attention. Avec environ un an d’ancienneté, Speech-02-HD est déjà très ancien à l’échelle de l’IA et doit être comparé aux modèles de sa période plutôt qu’aux solutions les plus récentes. Il est probablement dépassé par de nouvelles générations, tandis que son écart avec Simba 3.2 montre qu’il n’occupe pas la tête d’Arena. Les deux voix disponibles limitent aussi la variété des personnages, des registres ou des identités sonores. Usages pertinents : voix off, assistants vocaux, doublage à distribution réduite et outils d’accessibilité fondés sur la lecture de texte.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).