Kokoro 82M v1.0
Publié par Kokoro le 27 janvier 2025, Kokoro 82M v1.0 est un modèle de synthèse vocale open-weight de 82 millions de paramètres. Il transforme du texte en parole et ses poids sont proposés sous licence Apache, ce qui facilite son intégration et son adaptation.
Publié par Kokoro le 27 janvier 2025, Kokoro 82M v1.0 est un modèle de synthèse vocale open-weight de 82 millions de paramètres. Il transforme du texte en parole et ses poids sont proposés sous licence Apache, ce qui facilite son intégration et son adaptation.
Le modèle se place dans le haut du classement Arena text-to-speech, tout en restant derrière les solutions les mieux évaluées. Quatre voix sont indiquées comme disponibles, tandis que la version v1.0 couvre techniquement huit langues et 54 voix.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Synthèse vocale (text-to-speech) |
| Éditeur | Kokoro |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 27 janvier 2025 |
| Voix disponibles | 4 |
Classements Arena (Elo)
Arena Text-to-Speech · 88 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Gemini 3.1 Flash TTS | 1309 |
| 2ᵉ | Realtime TTS 1.5 Max | 1296 |
| 3ᵉ | Luna TTS | 1271 |
| ⋯ | ⋯ | |
| 63ᵉ | Chatterbox HD | 1020 |
| 64ᵉ | T2A-01-HD | 1020 |
| 65ᵉ | Kokoro 82M v1.0 | 1011 |
| 66ᵉ | SIMBA 1.0 | 1010 |
| 67ᵉ | OpenAudio S1 Mini | 1009 |
Notre analyse
Forces. Kokoro 82M v1.0 combine une taille contenue avec une architecture fondée sur StyleTTS 2 et ISTFTNet. Son décodeur fonctionne sans diffusion et aucun encodeur n’est publié. Le paquet kokoro s’appuie sur la bibliothèque G2P misaki. L’entraînement repose sur quelques centaines d’heures d’audio permissif ou non protégé par copyright, accompagnées d’étiquettes de phonèmes IPA. Son classement Arena, établi à partir de préférences humaines et confirmé par deux sources concordantes, le situe parmi les modèles bien placés de l’évaluation.
Limites et points d'attention. Âgé d’environ un an, Kokoro 82M v1.0 est déjà ancien à l’échelle de l’IA et probablement dépassé par plusieurs modèles de sa période. Son positionnement Arena reste nettement en retrait de celui des trois références de tête. Usages pertinents : voix off, assistants vocaux, doublage et accessibilité, notamment pour des projets recherchant des poids ouverts ; pour un résultat plus abouti, on lui préférera Simba 3.2, Gemini 3.1 Flash TTS ou Realtime TTS-2 - Research Preview.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).