GPT-Realtime-2
GPT-Realtime-2 est un modèle de synthèse vocale d’OpenAI, sorti le 7 mai 2026. Il transforme du texte en parole et propose quatre voix, ce qui permet de varier l’identité sonore selon les productions.
GPT-Realtime-2 est un modèle de synthèse vocale d’OpenAI, sorti le 7 mai 2026. Il transforme du texte en parole et propose quatre voix, ce qui permet de varier l’identité sonore selon les productions.
Dans l’Arena text-to-speech, fondée sur la préférence humaine, le modèle apparaît en retrait du classement. Son positionnement est notamment inférieur à celui de Simba 3.2, Gemini 3.1 Flash TTS et Realtime TTS-2 - Research Preview.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | OpenAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 7 mai 2026 |
| Voix disponibles | 4 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 53ᵉ | Multilingual v2 | 1062 |
| 54ᵉ | Turbo v2.5 | 1047 |
| 55ᵉ | GPT-Realtime-2 | 1046 |
| 56ᵉ | OpenAudio S1 | 1035 |
| 57ᵉ | Sonic 3 | 1034 |
Notre analyse
Forces. GPT-Realtime-2 offre quatre voix pour produire de la parole à partir d’un texte. Cette sélection permet d’envisager plusieurs identités vocales pour une voix off, un assistant vocal, un doublage ou la lecture de contenus à des fins d’accessibilité. Son évaluation dans l’Arena text-to-speech fournit également un signal de qualité fondé sur des préférences humaines. Le positionnement indiqué repose sur deux sources de données concordantes.
Limites et points d’attention. GPT-Realtime-2 se situe en retrait dans l’Arena, derrière plusieurs références de synthèse vocale. Il reste pertinent pour les équipes souhaitant évaluer les quatre voix d’OpenAI ou comparer plusieurs solutions sur des productions vocales concrètes. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité ; pour un résultat plus abouti, on lui préférera Simba 3.2, Gemini 3.1 Flash TTS ou Realtime TTS-2 - Research Preview.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).