Sonic 3.5
Sonic 3.5 est un modèle de synthèse vocale de Cartesia, sorti le 4 mai 2026. Il transforme du texte en parole et propose huit voix, un choix adapté à la production de contenus audio aux identités vocales distinctes.
Sonic 3.5 est un modèle de synthèse vocale de Cartesia, sorti le 4 mai 2026. Il transforme du texte en parole et propose huit voix, un choix adapté à la production de contenus audio aux identités vocales distinctes.
Le modèle se situe dans le groupe de tête de l’Arena text-to-speech, classement fondé sur la préférence humaine. Son positionnement parmi les quatre premiers sur 89 modèles indique une réception favorable face à un ensemble étendu de solutions concurrentes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Cartesia |
| Poids | 🔒 Propriétaire |
| Date de sortie | 4 mai 2026 |
| Voix disponibles | 8 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 6ᵉ | Qwen-Audio-3.0-TTS-Plus | 1258 |
| 7ᵉ | Realtime TTS-2 - Research Preview | 1254 |
| 8ᵉ | Sonic 3.5 | 1223 |
| 9ᵉ | Azure HD 2.5 | 1219 |
| 10ᵉ | Fish Audio S2 Pro | 1214 |
Notre analyse
Forces. Sonic 3.5 occupe une place élevée dans l’Arena text-to-speech, ce qui constitue un signal positif de préférence humaine pour ses restitutions vocales. Ses huit voix permettent de sélectionner plusieurs identités sonores selon le contenu ou le format produit. Le classement repose sur deux sources de données concordantes, ce qui renforce la cohérence du positionnement rapporté.
Limites et points d’attention. Sonic 3.5 reste derrière le modèle en tête de l’Arena, Simba 3.2. Son rang mesure une préférence globale dans ce classement, sans devoir être interprété comme une évaluation séparée de chaque usage. Le choix entre les huit voix reste donc à adapter au registre, au personnage ou au type de contenu visé. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).