Coda
Coda est un modèle de synthèse vocale de Rime, sorti le 19 mai 2026. Il transforme du texte en parole et propose sept voix, ce qui permet de varier l’identité vocale selon les productions.
Coda est un modèle de synthèse vocale de Rime, sorti le 19 mai 2026. Il transforme du texte en parole et propose sept voix, ce qui permet de varier l’identité vocale selon les productions.
Dans l’Arena text-to-speech, fondée sur la préférence humaine, Coda apparaît en retrait du classement. Son positionnement le place notamment derrière Simba 3.2, Gemini 3.1 Flash TTS et Realtime TTS-2 - Research Preview. Cette évaluation repose sur deux sources de données concordantes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Rime |
| Poids | 🔒 Propriétaire |
| Date de sortie | 19 mai 2026 |
| Voix disponibles | 7 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 48ᵉ | Flash v2.5 | 1083 |
| 49ᵉ | Magpie-Multilingual 357M (Feb 2026) | 1076 |
| 50ᵉ | Coda | 1069 |
| 51ᵉ | VibeVoice 1.5B | 1066 |
| 52ᵉ | xAI Text to Speech | 1064 |
Notre analyse
Forces. Coda met à disposition sept voix pour convertir des contenus écrits en parole. Ce choix peut servir à différencier plusieurs personnages, formats ou identités sonores au sein d’une production. Son évaluation dans l’Arena text-to-speech fournit également un indicateur de préférence humaine, utile pour situer sa qualité perçue face à d’autres modèles de synthèse vocale.
Limites et points d’attention. Coda se classe dans la moitié inférieure de l’Arena, loin des modèles placés en tête. Il reste pertinent pour des projets dont l’une des sept voix correspond au rendu recherché, notamment pour des voix off, des assistants vocaux, du doublage ou des fonctions d’accessibilité. Usages pertinents : production de parole dans ces quatre domaines, avec validation du rendu vocal selon le projet ; pour un résultat plus abouti selon l’Arena, on lui préférera Simba 3.2, Gemini 3.1 Flash TTS ou Realtime TTS-2 - Research Preview.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).