Grok Speech to Text, xAI
Grok Speech to Text est un modèle de reconnaissance vocale édité par xAI. Il convertit la parole en texte et se positionne à un niveau de précision élevé selon la mesure d’intelligibilité d’Artificial Analysis.
Grok Speech to Text est un modèle de reconnaissance vocale édité par xAI. Il convertit la parole en texte et se positionne à un niveau de précision élevé selon la mesure d’intelligibilité d’Artificial Analysis.
Son évaluation repose sur deux sources de données concordantes, ce qui renforce la cohérence du résultat observé. Le modèle vise les tâches dans lesquelles la fidélité de la transcription constitue le principal critère de qualité.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Reconnaissance vocale (speech-to-text) |
| Éditeur | xAI |
| Poids | ▫ n.d. |
| Date de sortie | 18 avril 2026 |
| Taux d'erreur de mots (WER) | 4,03 % (plus bas = meilleur) |
Notre analyse
Forces. Grok Speech to Text affiche un WER de 4,0 %, un niveau solide et proche du seuil généralement associé à une performance excellente, situé sous 3 %. Le WER mesure la proportion d’erreurs sur les mots, un résultat bas indique donc une transcription plus fidèle. La concordance de deux sources de données apporte un signal cohérent sur la qualité mesurée par Artificial Analysis.
Limites et points d’attention. Avec un WER de 4,0 %, la transcription conserve une part d’erreurs et ne relève pas de la catégorie d’excellence inférieure à 3 %. Une relecture reste donc pertinente lorsque chaque mot doit être restitué avec exactitude. Les usages pertinents comprennent le sous-titrage, la transcription de réunions, la dictée et la conversion de commandes vocales en texte.
Sources des données : Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com).