Voxtral TTS
Voxtral TTS est un modèle de synthèse vocale à poids ouverts lancé par Mistral AI le 26 mars 2026. Il transforme du texte en parole et propose trois voix disponibles, avec des voix de référence et des poids BF16.
Voxtral TTS est un modèle de synthèse vocale à poids ouverts lancé par Mistral AI le 26 mars 2026. Il transforme du texte en parole et propose trois voix disponibles, avec des voix de référence et des poids BF16.
Le modèle se situe dans le premier tiers de l’Arena text-to-speech, à distance du modèle en tête, Simba 3.2. Il prend en charge neuf langues, dont le français, ainsi que le streaming et le traitement par lots.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Mistral AI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 26 mars 2026 |
| Voix disponibles | 3 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 29ᵉ | Gemini 2.5 Flash Lite TTS | 1125 |
| 30ᵉ | Speech 2.8 Turbo | 1124 |
| 31ᵉ | Voxtral TTS | 1120 |
| 32ᵉ | Journey | 1115 |
| 33ᵉ | Eleven v3 | 1114 |
Notre analyse
Forces. Voxtral TTS combine génération vocale multilingue, adaptation à de nouvelles voix et plusieurs modes d’inférence. La sortie audio à 24 kHz peut être produite en WAV, PCM, FLAC, MP3, AAC ou Opus, ce qui facilite son intégration dans différentes chaînes de production. Le streaming convient aux interactions en temps réel, tandis que l’inférence batch répond aux besoins de génération en volume. Le modèle peut être déployé avec vLLM-Omni et fonctionner sur un seul GPU doté d’au moins 16 Go de mémoire.
Limites et points d’attention. Son classement dans le premier tiers de l’Arena indique une préférence humaine favorable, mais reste nettement inférieur à celui de Simba 3.2, leader du classement. Le choix immédiat repose sur trois voix disponibles, même si l’adaptation à de nouvelles voix étend les possibilités de personnalisation. Usages pertinents : voix off multilingues, assistants vocaux, doublage, contenus audio automatisés et outils d’accessibilité.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).