Magpie-Multilingual 357M (Feb 2026)

Magpie-Multilingual 357M (Feb 2026) est un modèle de synthèse vocale publié par NVIDIA le 27 février 2026. Il transforme du texte en parole avec cinq voix couvrant neuf langues, dont le français, l’anglais, l’espagnol, le mandarin et le japonais.

Magpie-Multilingual 357M (Feb 2026) est un modèle de synthèse vocale publié par NVIDIA le 27 février 2026. Il transforme du texte en parole avec cinq voix couvrant neuf langues, dont le français, l’anglais, l’espagnol, le mandarin et le japonais.

Dans Arena, il se place en retrait du classement, derrière Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max et Luna TTS. Gemini 3.1 Flash TTS est nettement devant dans les duels de préférence humaine.

Caractéristiques

CaractéristiqueValeur
TypeSynthèse vocale (text-to-speech)
ÉditeurNVIDIA
Poids🟢 Poids ouverts
Date de sortie27 février 2026
Voix disponibles5

Classements Arena (Elo)

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
38ᵉSpeech 02 Turbo1108
39ᵉSIMBA 1.61105
40ᵉMagpie-Multilingual 357M (Feb 2026)1104
41ᵉStep Audio EditX (Mar 2026)1097
42ᵉT2A-01-Turbo1093

Arena Text-to-Speech · 88 modèles classés

RangModèleElo
1ᵉGemini 3.1 Flash TTS1309
2ᵉRealtime TTS 1.5 Max1296
3ᵉLuna TTS1271
38ᵉSpeech 02 Turbo1108
39ᵉSIMBA 1.61105
40ᵉMagpie-Multilingual 357M (Feb 2026)1104
41ᵉStep Audio EditX (Mar 2026)1097
42ᵉT2A-01-Turbo1093

Notre analyse

Forces. Ce modèle de 357 millions de paramètres repose sur un Transformer encodeur-décodeur causal, avec six couches d’encodage, douze couches de décodage et un Transformer local optionnel. La génération autorégressive utilise plusieurs livres de codes audio, généralement huit, puis NanoCodec produit l’onde sonore. Les cinq voix prennent en charge l’anglais, l’espagnol, l’allemand, le français, le vietnamien, l’italien, le mandarin, l’hindi et le japonais. NeMo permet l’inférence unitaire ou par lots, la génération hors ligne et l’intégration à des agents vocaux en streaming.

Limites et points d'attention. Les évaluations Arena le situent autour du milieu du tableau et loin du groupe de tête. L’écart avec Gemini 3.1 Flash TTS est important en préférence humaine. Le choix se limite aussi à cinq voix, ce qui peut contraindre les productions nécessitant de nombreux personnages ou timbres distincts. Usages pertinents : voix off multilingue, assistants vocaux, doublage et accessibilité ; pour un résultat plus abouti, on lui préférera Gemini 3.1 Flash TTS, Realtime TTS 1.5 Max ou Luna TTS.


Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).