Magpie-Multilingual 357M (Feb 2026)
Magpie-Multilingual 357M (Feb 2026) est un modèle de synthèse vocale publié par NVIDIA le 27 février 2026. Il transforme du texte en parole avec cinq voix couvrant neuf langues, dont le français, l’anglais, l’espagnol, le mandarin et le japonais.
Magpie-Multilingual 357M (Feb 2026) est un modèle de synthèse vocale publié par NVIDIA le 27 février 2026. Il transforme du texte en parole avec cinq voix couvrant neuf langues, dont le français, l’anglais, l’espagnol, le mandarin et le japonais.
Dans Arena, il se place en retrait du classement, derrière Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max et Luna TTS. Gemini 3.1 Flash TTS est nettement devant dans les duels de préférence humaine.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | NVIDIA |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 27 février 2026 |
| Voix disponibles | 5 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 38ᵉ | Speech 02 Turbo | 1108 |
| 39ᵉ | SIMBA 1.6 | 1105 |
| 40ᵉ | Magpie-Multilingual 357M (Feb 2026) | 1104 |
| 41ᵉ | Step Audio EditX (Mar 2026) | 1097 |
| 42ᵉ | T2A-01-Turbo | 1093 |
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 38ᵉ | Speech 02 Turbo | 1108 |
| 39ᵉ | SIMBA 1.6 | 1105 |
| 40ᵉ | Magpie-Multilingual 357M (Feb 2026) | 1104 |
| 41ᵉ | Step Audio EditX (Mar 2026) | 1097 |
| 42ᵉ | T2A-01-Turbo | 1093 |
Notre analyse
Forces. Ce modèle de 357 millions de paramètres repose sur un Transformer encodeur-décodeur causal, avec six couches d’encodage, douze couches de décodage et un Transformer local optionnel. La génération autorégressive utilise plusieurs livres de codes audio, généralement huit, puis NanoCodec produit l’onde sonore. Les cinq voix prennent en charge l’anglais, l’espagnol, l’allemand, le français, le vietnamien, l’italien, le mandarin, l’hindi et le japonais. NeMo permet l’inférence unitaire ou par lots, la génération hors ligne et l’intégration à des agents vocaux en streaming.
Limites et points d'attention. Les évaluations Arena le situent autour du milieu du tableau et loin du groupe de tête. L’écart avec Gemini 3.1 Flash TTS est important en préférence humaine. Le choix se limite aussi à cinq voix, ce qui peut contraindre les productions nécessitant de nombreux personnages ou timbres distincts. Usages pertinents : voix off multilingue, assistants vocaux, doublage et accessibilité ; pour un résultat plus abouti, on lui préférera Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max ou Luna TTS.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).