MAI-Voice-1
MAI-Voice-1 est un modèle de synthèse vocale de Microsoft, sorti le 2 avril 2026. Il transforme du texte en parole et propose quatre voix, ce qui permet de varier l’identité vocale selon le contenu produit.
MAI-Voice-1 est un modèle de synthèse vocale de Microsoft, sorti le 2 avril 2026. Il transforme du texte en parole et propose quatre voix, ce qui permet de varier l’identité vocale selon le contenu produit.
Dans l’Arena text-to-speech, fondée sur la préférence humaine, MAI-Voice-1 se situe en retrait des modèles les mieux classés. Son positionnement le destine notamment aux équipes qui souhaitent évaluer une solution Microsoft pour produire des voix off, des assistants vocaux, du doublage ou des contenus accessibles.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Microsoft |
| Poids | ▫ n.d. |
| Date de sortie | 2 avril 2026 |
| Voix disponibles | 4 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 34ᵉ | Gemini 2.5 Pro | 1113 |
| 35ᵉ | Gradium TTS (Jun 2026) | 1113 |
| 36ᵉ | MAI-Voice-1 | 1111 |
| 37ᵉ | MiMo-V2-TTS | 1111 |
| 38ᵉ | Speech 02 Turbo | 1108 |
Notre analyse
Forces. MAI-Voice-1 fournit quatre voix pour convertir des textes en contenus parlés. Cette sélection permet d’attribuer différentes identités vocales à plusieurs formats ou rôles. Son évaluation dans l’Arena text-to-speech apporte un indicateur de préférence humaine directement lié au rendu vocal, avec un positionnement couvert par deux sources de données concordantes.
Limites et points d’attention. MAI-Voice-1 reste en retrait du classement Arena et se place derrière Simba 3.2, Gemini 3.1 Flash TTS et Realtime TTS-2 - Research Preview. Il demeure pertinent pour des équipes qui évaluent les quatre voix proposées par Microsoft ou recherchent une base de synthèse vocale pour leurs productions. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité ; pour un résultat plus abouti selon la préférence humaine en Arena, on lui préférera Simba 3.2, Gemini 3.1 Flash TTS ou Realtime TTS-2 - Research Preview.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).