Gradium TTS Beta Gradium TTS Beta est un modèle de synthèse vocale développé par Gradium et sorti le 30 juillet 2026. Il transforme du texte en parole et propose quatre voix.
Qwen: Qwen-Audio-3.0-TTS Flash Qwen: Qwen-Audio-3.0-TTS Flash est un modèle de synthèse vocale édité par Qwen et sorti le 23 juillet 2026. Il transforme du texte en parole pour produire des contenus audio à partir de scripts ou de réponses écrites.
Microsoft: MAI-Voice-2-Flash Microsoft: MAI-Voice-2-Flash est un modèle de synthèse vocale de Microsoft. Il transforme du texte en parole et sa sortie est fixée au 23 juillet 2026. Son positionnement économique cible les projets qui accordent une place importante au coût de génération.
Maya 2 Global Maya 2 Global est un modèle de synthèse vocale de Maya Research, sorti le 17 juillet 2026. Il transforme du texte en parole et propose quatre voix, ce qui permet de varier l’identité vocale selon le contenu.
Maya 2 Flash Maya 2 Flash est un modèle de synthèse vocale de Maya Research, sorti le 17 juillet 2026. Il transforme du texte en parole et propose quatre voix, un choix destiné à varier les rendus vocaux.
Deepgram: Aura-2 Deepgram: Aura-2 est un modèle de synthèse vocale de Deepgram, sorti le 16 juillet 2026. Il transforme un texte écrit en parole et vise les applications qui nécessitent de produire une voix à partir d’un script.
Speech 2.6 Speech 2.6 est un modèle de synthèse vocale de Hithink, sorti le 5 juillet 2026. Il transforme du texte en parole et propose quatre voix, ce qui permet de varier l’identité vocale selon les productions.
Simba 3.2 Simba 3.2 est un modèle de synthèse vocale de SpeechifyAI, sorti le 1er juillet 2026. Il transforme du texte en parole et propose quatre voix, ce qui permet de sélectionner différents rendus vocaux pour une production audio.
Qwen-Audio-3.0-TTS-Plus Qwen-Audio-3.0-TTS-Plus est un modèle de synthèse vocale édité par Qwen et sorti le 1er juillet 2026. Il transforme du texte en parole et propose quatre voix, un choix adapté à la création de plusieurs identités vocales au sein d’un même projet.
Fish Audio S2.1 Pro Fish Audio S2.1 Pro est un modèle de synthèse vocale développé par Fish Audio et sorti le 23 juin 2026. Il transforme du texte en parole et propose huit voix, ce qui permet de varier les rendus selon les productions.
Luna TTS Luna TTS est un modèle de synthèse vocale de VUI Labs, sorti le 18 juin 2026. Il transforme du texte en parole et propose trois voix, ce qui permet de choisir entre plusieurs identités vocales.
Lightning V3.1 Pro TTS (Jun 2026) Lightning V3.1 Pro TTS (Jun 2026) est un modèle de synthèse vocale de Smallest.ai, sorti le 12 juin 2026. Il transforme du texte en parole et propose huit voix.
Gradium TTS (Jun 2026) Gradium TTS (Jun 2026) est un modèle de synthèse vocale édité par Gradium et sorti le 10 juin 2026. Il transforme du texte en parole et propose un catalogue de huit voix.
Fun-Realtime-TTS Fun-Realtime-TTS est un modèle de synthèse vocale de Qwen, sorti le 28 mai 2026. Il transforme du texte en parole et propose huit voix.
Async Pro v1.0 Async Pro v1.0 est un modèle de synthèse vocale publié par async le 25 mai 2026. Il transforme du texte en parole et propose huit voix, un choix adapté à la création de plusieurs identités vocales.
Coda Coda est un modèle de synthèse vocale de Rime, sorti le 19 mai 2026. Il transforme du texte en parole et propose sept voix, ce qui permet de varier l’identité vocale selon les productions.
GPT-Realtime-2 GPT-Realtime-2 est un modèle de synthèse vocale d’OpenAI, sorti le 7 mai 2026. Il transforme du texte en parole et propose quatre voix, ce qui permet de varier l’identité sonore selon les productions.
Realtime TTS-2 - Research Preview Realtime TTS-2 - Research Preview est un modèle de synthèse vocale d’Inworld, sorti le 5 mai 2026. Il transforme du texte en parole et propose huit voix.
Sonic 3.5 Sonic 3.5 est un modèle de synthèse vocale de Cartesia, sorti le 4 mai 2026. Il transforme du texte en parole et propose huit voix, un choix adapté à la production de contenus audio aux identités vocales distinctes.
StepAudio 2.5 TTS StepAudio 2.5 TTS est un modèle de synthèse vocale développé par StepFun et sorti le 30 avril 2026. Il transforme du texte en parole et propose trois voix.
MiMo-V2.5-TTS MiMo-V2.5-TTS est un modèle de synthèse vocale développé par Xiaomi. Il transforme du texte en parole et propose quatre voix, offrant plusieurs options pour adapter la restitution vocale aux contenus produits.
Gemini 3.1 Flash TTS Gemini 3.1 Flash TTS est un modèle de synthèse vocale de Google, sorti le 15 avril 2026. Il transforme du texte en parole et propose trois voix.
MAI-Voice-1 MAI-Voice-1 est un modèle de synthèse vocale de Microsoft, sorti le 2 avril 2026. Il transforme du texte en parole et propose quatre voix, ce qui permet de varier l’identité vocale selon le contenu produit.
Azure HD 2.5 Azure HD 2.5 est un modèle de synthèse vocale de Microsoft, sorti le 30 mars 2026. Il transforme du texte en parole et propose huit voix, ce qui permet de varier les restitutions vocales.
Voxtral TTS Voxtral TTS est un modèle de synthèse vocale à poids ouverts lancé par Mistral AI le 26 mars 2026. Il transforme du texte en parole et propose trois voix disponibles, avec des voix de référence et des poids BF16.
Lightning v3.1 Lightning v3.1 est un modèle de synthèse vocale publié par Smallest.ai le 24 mars 2026. Il transforme du texte en parole et propose un catalogue de sept voix, afin de varier l’identité vocale selon la production.
MiMo-V2-TTS MiMo-V2-TTS est un modèle de synthèse vocale de Xiaomi, sorti le 18 mars 2026. Il transforme du texte en parole et propose une seule voix, ce qui le destine aux productions fondées sur une identité vocale unique.
xAI Text to Speech Publié par xAI le 16 mars 2026, xAI Text to Speech est un modèle de synthèse vocale qui transforme du texte en parole. Son catalogue comprend six voix, offrant plusieurs options pour adapter la restitution sonore aux contenus.
Fish Audio S2 Pro Fish Audio S2 Pro est un modèle de synthèse vocale publié par Fish Audio le 10 mars 2026. Il transforme du texte en parole dans plus de 80 langues et propose quatre voix, avec une prise en charge prioritaire du japonais, de l’anglais et du chinois.
Magpie-Multilingual 357M (Feb 2026) Magpie-Multilingual 357M (Feb 2026) est un modèle de synthèse vocale publié par NVIDIA le 27 février 2026. Il transforme du texte en parole avec cinq voix couvrant neuf langues, dont le français, l’anglais, l’espagnol, le mandarin et le japonais.
SIMBA 3.0 SIMBA 3.0 est un modèle de synthèse vocale de Speechify, sorti le 19 février 2026. Il transforme du texte en parole et propose huit voix, ce qui permet de varier les rendus vocaux.
Speech 2.8 Turbo Lancé par MiniMax le 14 février 2026, Speech 2.8 Turbo est un modèle de synthèse vocale qui transforme du texte en parole. Son catalogue comprend quatre voix, une sélection destinée à couvrir plusieurs besoins de production audio.
Step TTS 2 (Mar 2026) Publié le 12 février 2026 par StepFun, Step TTS 2 (Mar 2026) est un modèle de synthèse vocale qui transforme du texte en parole. Il propose deux voix, un choix resserré pour produire des contenus parlés avec deux rendus distincts.
Arcana v3 Conçu par Rime et sorti le 4 février 2026, Arcana v3 est un modèle de synthèse vocale. Il transforme du texte en parole et propose quatre voix pour produire différents rendus vocaux.
Eleven v3 Eleven v3 est un modèle de synthèse vocale d’ElevenLabs, sorti le 2 février 2026. Il transforme du texte en parole et propose quatre voix.
Realtime TTS 1.5 Max Realtime TTS 1.5 Max est un modèle de synthèse vocale publié par Inworld le 21 janvier 2026. Il transforme du texte en parole et propose quatre voix.
Qwen3 TTS Flash Qwen3 TTS Flash est un modèle de synthèse vocale publié par Qwen le 22 septembre 2025. Il transforme du texte en parole et propose quatre voix, ce qui permet de varier les rendus vocaux selon les productions.
Maya1 Maya1 est un modèle de synthèse vocale publié par Maya Research le 25 juin 2025. Il transforme du texte en parole et propose deux voix, avec un contrôle de leur style par des descriptions en langage naturel.
OpenAudio S1 Mini OpenAudio S1 Mini est un modèle de synthèse vocale de Fish Audio, sorti le 3 juin 2025. Il transforme du texte en parole et propose quatre voix, notamment pour produire des voix off, alimenter des assistants vocaux, réaliser du doublage ou améliorer l’accessibilité de contenus écrits.
Chatterbox HD Chatterbox HD est un modèle de synthèse vocale publié par Resemble AI le 28 mai 2025. Il transforme du texte en parole et peut servir à produire des contenus audio à partir de scripts écrits.
Speech 02 HD Speech-02-HD est un modèle de synthèse vocale de MiniMax, sorti le 31 mars 2025. Il transforme du texte en parole et propose deux voix, un choix restreint qui le destine surtout aux productions ne nécessitant pas une grande diversité vocale.
Octave TTS Octave TTS est un modèle de synthèse vocale développé par Hume AI et publié le 26 février 2025. Il transforme du texte en parole et propose quatre voix, un choix adapté à la création de plusieurs identités vocales.
Zonos-v0.1 Zonos-v0.1 est un modèle de synthèse vocale publié par Zyphra le 10 février 2025. Il transforme du texte en parole et propose quatre voix, ce qui permet de varier les rendus au sein d’un même projet audio.
Kokoro 82M v1.0 Publié par Kokoro le 27 janvier 2025, Kokoro 82M v1.0 est un modèle de synthèse vocale open-weight de 82 millions de paramètres. Il transforme du texte en parole et ses poids sont proposés sous licence Apache, ce qui facilite son intégration et son adaptation.
Flash v2.5 Flash v2.5 est un modèle de synthèse vocale d’ElevenLabs, sorti le 18 décembre 2024. Il transforme du texte en parole et propose quatre voix, un choix resserré pour produire des contenus audio.
SIMBA 1.6 SIMBA 1.6 est un modèle de synthèse vocale de Speechify, sorti le 1 octobre 2024. Il transforme du texte en parole et propose trois voix, une sélection adaptée aux projets qui exigent peu de variantes vocales.
Polly Generative Polly Generative est un modèle de synthèse vocale d’Amazon, lancé le 8 mai 2024. Il transforme du texte en parole et propose quatre voix, un choix resserré pour produire des contenus audio.
OpenVoice v2 OpenVoice v2 est un modèle de synthèse vocale publié par OpenVoice le 1er avril 2024. Il transforme du texte en parole et peut reproduire la couleur de ton d’une voix de référence, y compris entre différentes langues sans entraînement préalable.
MetaVoice v1 MetaVoice v1 est un modèle de synthèse vocale publié par MetaVoice le 6 février 2024. Il transforme du texte en parole et peut ainsi alimenter des productions audio ou des interfaces vocales.
Journey Journey est un modèle de synthèse vocale de Google, lancé le 23 décembre 2023. Il transforme du texte en parole et propose une seule voix, ce qui le destine à des productions vocales au rendu uniforme plutôt qu’à des projets nécessitant plusieurs identités sonores.
LMNT LMNT est un modèle de synthèse vocale publié par l’éditeur LMNT le 12 décembre 2023. Il transforme du texte en parole et propose une seule voix, ce qui le destine à des productions vocales ne nécessitant pas de variété de timbres.
Polly Long-Form Polly Long-Form est un modèle de synthèse vocale d’Amazon, sorti le 16 novembre 2023. Il transforme du texte en parole et propose trois voix, un choix limité mais exploitable pour plusieurs formats audio.
XTTS v2 XTTS v2 est un modèle de synthèse vocale publié par Coqui le 8 novembre 2023. Il transforme du texte en parole dans 17 langues et peut cloner une voix, y compris en translingue, à partir d’un extrait audio de six secondes.
TTS-1 TTS-1 est un modèle de synthèse vocale propriétaire développé par OpenAI. Il transforme du texte en parole et propose cinq voix, un choix adapté à différents formats de production audio.
TTS-1 HD TTS-1 HD est un modèle de synthèse vocale publié par OpenAI le 6 novembre 2023. Il transforme du texte en parole et propose cinq voix, ce qui permet de varier l’identité vocale selon les contenus produits.
StyleTTS 2 StyleTTS 2 est un modèle de synthèse vocale publié par StyleTTS le 13 juin 2023. Il transforme du texte en parole et peut servir à produire des voix off, des interfaces vocales, du doublage ou des contenus destinés à l’accessibilité.